Kagi LLM Benchmark: leaderboard

Metric: Accuracy (%). Source: help.kagi.com. 145 models tracked.

Top models

#ModelScore
1GPT-5.588.8
2Claude Fable 588.8
3Claude Opus 4.6 (Thinking)83.6
4Grok 4.583.5
5Claude Opus 4.7 (Thinking)80.7
6Claude Opus 4.5 (Thinking)80.2
7Gemini 3 Pro80.1
8Kimi K2.5 (Thinking)78.5
9GPT-5 Pro76.8
10GLM-5 (Thinking)75
11Grok 4.20 (Reasoning)75
12Claude Opus 4 (Thinking)74.3
13Grok 473.6
14GPT-5.273.3
15Claude Opus 4.773.3

Interactive version: theaggregate.ai/benchmark?slug=kagi-llm-benchmark · How It Works · Data refreshed daily, snapshot 2026-09-05.