Agentic Skills Evaluation Framework: leaderboard

Metric: Overall Score w/ (self-reported). Source: benchmarklist.com. 19 models tracked.

Top models

#ModelScore
1Claude Opus 4.892.7
2Claude Opus 4.792.3
3Claude Sonnet 4.691.5
4GLM-5.191.1
5Gemini 3.5 Flash88.6
6Gemini 3.1 Pro (Preview)88.5
7GPT-5.488.2
8DeepSeek V4 Pro86.6
9Gemini 3 Flash (Preview)85.9
10GPT-5.4 Mini84.5
11Claude Haiku 4.584.1
12DeepSeek V4 Flash83.9
13GPT-5.4 Nano81.9
14Kimi K2.676.1
15Gemini 3.1 Flash Lite71.4

Interactive version: theaggregate.ai/benchmark?slug=agentic-skills-evaluation-framework · How It Works · Data refreshed daily, snapshot 2026-09-05.