Honestly evaluate AI work quality using a two-axis scoring system. Use after completing a task, code review, or work session to get an unbiased assessment. Detects score inflation, forces devil's advocate reasoning, and persists scores across sessions. Use when the user runs /self-eval, asks to evaluate my work quality / self-assessment / review this task / check if the score is inflated / honest review / rate my work. Do NOT use for grading user answers or producing production artifacts.