PhenoBench-LLM - All-Task Win Rate: leaderboard

Metric: Pairwise win rate (%; all available head-to-heads, 22-40 tasks per model). Source: github.com. 14 models tracked.

Top models

#ModelScore
1Gemini 3.7 Flash79
2Claude Sonnet 569.5
3Claude Opus 4.868.18
4Gemini 3.1 Pro (Preview)65.34
5GPT-5.6 Luna55.41
6Gemini 3.1 Flash Lite54.98
7Grok 4.353.03
8Nova Pro46.54
9Claude Haiku 4.544.48
10Llama 4 Maverick43.4
11DeepSeek V4 Pro36.07
12Llama 3.3 70B31.82
13Pixtral Large31.82
14GPT-5.4 Nano29.76

Interactive version: theaggregate.ai/benchmark?slug=phenobench-llm-all-task-win-rate · How It Works · Data refreshed daily, snapshot 2026-09-19.