PhenoBench-LLM - Common-Task Win Rate: leaderboard
Metric: Pairwise win rate (%; 11 tasks run by all models). Source: github.com. 14 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemini 3.7 Flash | 82.52 |
| 2 | Claude Opus 4.8 | 73.43 |
| 3 | Claude Sonnet 5 | 72.73 |
| 4 | Gemini 3.1 Pro (Preview) | 63.29 |
| 5 | GPT-5.6 Luna | 62.24 |
| 6 | Gemini 3.1 Flash Lite | 56.64 |
| 7 | Claude Haiku 4.5 | 47.2 |
| 8 | Nova Pro | 46.85 |
| 9 | Grok 4.3 | 46.15 |
| 10 | Llama 4 Maverick | 39.51 |
| 11 | Llama 3.3 70B | 32.87 |
| 12 | DeepSeek V4 Pro | 30.07 |
| 13 | Pixtral Large | 25.87 |
| 14 | GPT-5.4 Nano | 20.63 |
Interactive version: theaggregate.ai/benchmark?slug=phenobench-llm-common-task-win-rate · How It Works · Data refreshed daily, snapshot 2026-09-19.