SelfBench - mupt-ai/self-bench: leaderboard

Metric: Task success (%) on 38 tasks rebuilt from the repository's merged pull requests (hidden tests). Source: selfbench.dev. Saturation forecast: Around June 2027. 6 models tracked.

Top models

#ModelScoreOverall rank
1GPT-6.1 Sol (High)76.32#9 (GPT-6.1 Sol)
2Claude Opus 5.5 (High)71.05#3 (Claude Opus 5.5)
3GPT-6.1 Sol (Low)65.79#9 (GPT-6.1 Sol)
4Kimi K3 (High)63.16#25 (Kimi K3)
5GLM-5.3 (High)52.63#36 (GLM-5.3)
6GPT-6 Luna (High)47.37#49 (GPT-6 Luna)

No result here: #5 GPT-6 Astra, #8 Claude Fable 5.1, #10 Claude Sonnet 5.5.

Interactive version: theaggregate.ai/benchmark?slug=selfbench-mupt-ai-self-bench · How It Works · Data refreshed daily, snapshot 2026-10-11.