Independently tries to falsify a near-final agent output, plan, code change, or workflow. Use before shipping consequential work where plausible-looking defects could survive normal review. Not for routine evidence collection or designing a reusable eval suite.