Use when improving a prompt, skill, eval, benchmark, scorer, calibration, judge, golden dataset, or agent workflow quality, and when the user says golden benchmark, golden dataset, golden regression, blind validation, unbiased evaluator, answer key contamination, uplift loop, before/after measurement, scorer calibration, prompt eval, or skill eval. Requires blind validation when the author has seen the answer key, deterministic grading, before/after measurement, and honest sample-size caveats.