Agentic Skills Evaluation Framework — leaderboard

Metric: Overall Score w/ (self-reported). Source: benchmarklist.com. 19 models tracked.

Top models

#ModelScore
1Claude Opus 4.892.7
2Claude Opus 4.792.3
3Claude Sonnet 4.691.5
4GLM-5.191.1
5Gemini 3.5 Flash88.6
6Gemini 3.1 Pro (Preview)88.5
7GPT-5.488.2
8DeepSeek V4 Pro86.6
9Gemini 3 Flash (Preview)85.9
10GPT-5.4 Mini84.5
11Claude Haiku 4.584.1
12DeepSeek V4 Flash83.9
13GPT-5.4 Nano81.9
14Gemini 3.1 Flash Lite71.4
15Qwen3 Coder Next70.8

Interactive version: theaggregate.ai/benchmark?slug=agentic-skills-evaluation-framework · How the rankings work · Data refreshed daily, snapshot 2026-07-22.