Opper TaskBench — leaderboard

Metric: Avg Task Score (%). Source: opper.ai. 86 models tracked.

Top models

#ModelScore
1Claude Fable 596.4
2Claude Opus 4.795.4
3Gemini 3.1 Pro (Preview)95.3
4Gemini 3 Flash (Preview)95.1
5Gemini 3 Pro (Preview)94.8
6Gemini 3.5 Flash94.7
7Claude Opus 4.894.5
8GPT-5.3 Codex94.5
9Claude Opus 4.694.4
10Qwen 3.7 Max93.3
11DeepSeek V4 Pro93.1
12Claude Opus 4.593
13GLM-5.293
14Kimi K2.592.2
15GLM-592.2

Interactive version: theaggregate.ai/benchmark?slug=opper-taskbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.