Ko-AgentBench - L1 Single Tool Call — leaderboard

Metric: Argument Accuracy (%). Source: huggingface.co. 15 models tracked.

Top models

#ModelScore
1nova-2-lite-v179.55
2Qwen 3 Next 80B A3B77.27
3Grok 4.1 Fast75
4GPT-572.73
5Gemini 2.5 Pro70.45
6GPT-5 Mini70.45
7GLM-4.6V68.18
8GPT-4o Mini65.91
9Claude Sonnet 4.565.91
10Gemini 2.5 Flash Lite63.64
11Gemini 2.5 Flash61.36
12Claude Haiku 4.561.36
13GPT-4o59.09
14Nova Lite59.09
15DeepSeek V3.154.55

Interactive version: theaggregate.ai/benchmark?slug=ko-agentbench-l1-single-tool-call · How the rankings work · Data refreshed daily, snapshot 2026-07-22.