Design a repository-specific AI coding evaluation from eligible merged pull requests. Use when selecting a model or harness for a real codebase and you need leak-resistant tasks, clean execution surfaces, hidden checks, paired runs, and repository-scoped conclusions instead of public leaderboard generalization.