KOR-Bench: leaderboard

Metric: Accuracy (%; zero-shot, 1,250 questions). Source: arxiv.org. Saturation forecast: Estimated already saturated. 38 models tracked.

Top models

#ModelScore
1O1 Preview (2024-09-12)72.88
2O1 Mini (2024-09-12)70.16
3Claude 3.5 Sonnet (20240620)58.96
4GPT-4o (2024-05-13)58
5Llama 3.1 405B Instruct55.36
6Qwen 2.5 32B Instruct54.72
7GPT-4 Turbo53.52
8Mistral Large 2 (Jul)53.12
9Qwen 2.5 72B Instruct52.16
10Llama 3.1 70B Instruct50
11Yi Large50
12Qwen 2.5 14B Instruct49.36
13Llama 3 70B Instruct49.2
14DeepSeek V2.547.76
15Qwen 2 72B Instruct47.04

Interactive version: theaggregate.ai/benchmark?slug=kor-bench · How It Works · Data refreshed daily, snapshot 2026-09-24.