WolfBench — leaderboard

WolfBench evaluates model capability on agentic tasks from the linked upstream source with Average as the primary reported metric.

Metric: Average Score (%). Source: wolfbench.ai. Status: saturation imminent. 32 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol87
2GPT-5.6 Terra82
3GPT-5.579
4GPT-5.6 Luna79
5Claude Opus 4.775
6Claude Sonnet 574
7Gemini 3.5 Flash72
8GPT-5.471
9Claude Opus 4.671
10GLM-5.271
11Claude Fable 568
12Claude Sonnet 4.662
13Kimi K2.660
14Gemini 3.1 Pro (Preview)59
15Kimi K2.7 Code58

Interactive version: theaggregate.ai/benchmark?slug=wolfbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.