Ko-AgentBench - L5 Error Handling & Robustness — leaderboard

Metric: Adaptive Routing Score (%). Source: huggingface.co. 15 models tracked.

Top models

#ModelScore
1Grok 4.1 Fast34.75
2GPT-530
3nova-2-lite-v126.25
4GLM-4.6V26.01
5GPT-4o25.83
6Qwen 3 Next 80B A3B25.42
7Claude Haiku 4.522.83
8GPT-4o Mini21.71
9DeepSeek V3.121.33
10Claude Sonnet 4.518.92
11Nova Lite13.76
12Gemini 2.5 Pro12.5
13Gemini 2.5 Flash Lite12.5
14Gemini 2.5 Flash10
15GPT-5 Mini9.17

Interactive version: theaggregate.ai/benchmark?slug=ko-agentbench-l5-error-handling-robustness · How the rankings work · Data refreshed daily, snapshot 2026-07-22.