Use when developing or validating reinforcement-learning-machine/coding-agent behavior end to end. Especially useful for agent workflow design, tool/action contracts, qualitative coding-agent generalization, project-building gates, promotion loops, and coordinating SFT, RL, eval, harness, and dataset work into one production path.