LLM2014 Logic 2026-09: leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 46 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (xHigh)70.03
2Claude Opus 5 (xHigh)64.42
3Kimi K3 (Max)64.32
4Claude Fable 5.1 (xHigh)63.47
5Gemini 3.8 Flash (High)62.05
6GLM-5.3 (Max)59.76
7GLM-5.3 Flash (Max)57.61
8Gemini 3.7 Flash (High)56.71
9Gemini 3.1 Pro (Preview) (High)56.34
10DeepSeek V4 Pro (0813) (Max)56.15
11Qwen 3.8 Max (xHigh)55.61
12Grok 4.6 (High)53.17
13DeepSeek V4 Flash (0731) (Max)51.48
14GPT-5.6 Luna (xHigh)47.86
15Qwen 3.8 27B (xHigh)43.05

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2026-09 · How It Works · Data refreshed daily, snapshot 2026-09-05.