Klu LLM Leaderboard — leaderboard

Compare models from Anthropic, Google, OpenAI, DeepSeek, and more across key text-only benchmarks with regular updates.

Metric: Klu Index. Source: klu.ai. Status: saturated. 48 models tracked.

Top models

#ModelScore
1GPT-4 Turbo100
2GPT-4 Turbo (Preview)100
3O1 Preview99
4Claude 3.5 Sonnet97
5Gemini 1.5 Pro96
6Claude 3 Opus91
7Gemini 1.5 Flash89
8Llama 3.1 405B89
9Mistral Large 2 (Jul)88
10Llama 3.1 70B86
11Gemma 2 27B83
12Claude 3 Haiku82
13Claude 3 Sonnet82
14Mistral Large79
15GPT-4 (0613)79

Interactive version: theaggregate.ai/benchmark?slug=klu-llm-leaderboard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.