SelfBench - earendil-works/pi: leaderboard

Metric: Task success (%) on 51 tasks rebuilt from the repository's merged pull requests (hidden tests). Source: selfbench.dev. Saturation forecast: Around January 2027. 10 models tracked.

Top models

#ModelScore
1GPT-6 Sol (High)84.31
2GPT-6.1 Sol (High)82.35
3GPT-6.1 Sol (Low)82.35
4Claude Opus 5.5 (High)82.35
5GPT-6 Sol (Low)78.43
6Claude Opus 5.5 (Low)76.47
7Kimi K3 (High)74.51
8GPT-6 Luna (High)68.63
9GPT-6 Luna (Low)56.86

Interactive version: theaggregate.ai/benchmark?slug=selfbench-earendil-works-pi · How It Works · Data refreshed daily, snapshot 2026-10-03.