PhenoBench-LLM - Common-Task Win Rate: leaderboard

Metric: Pairwise win rate (%; 11 tasks run by all models). Source: github.com. 14 models tracked.

Top models

#ModelScore
1Gemini 3.7 Flash82.52
2Claude Opus 4.873.43
3Claude Sonnet 572.73
4Gemini 3.1 Pro (Preview)63.29
5GPT-5.6 Luna62.24
6Gemini 3.1 Flash Lite56.64
7Claude Haiku 4.547.2
8Nova Pro46.85
9Grok 4.346.15
10Llama 4 Maverick39.51
11Llama 3.3 70B32.87
12DeepSeek V4 Pro30.07
13Pixtral Large25.87
14GPT-5.4 Nano20.63

Interactive version: theaggregate.ai/benchmark?slug=phenobench-llm-common-task-win-rate · How It Works · Data refreshed daily, snapshot 2026-09-19.