对 AutoResearch 的正式 Baseline 做只读合理性审查,检查训练不足、实现故障、预算或 seed 不公平及缺乏代表性的弱对照,区分合理 naive Starter 与评分锚点。适用于专家提交包和 Baseline/Reference 证据复核,不用于求解任务或要求 Baseline 达到 SOTA。