LLM2014 Logic 2026-07: leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 45 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)77.46
2Kimi K3 (Max)74.8
3GPT-5.6 Sol (xHigh)72.99
4Claude Opus 5 (xHigh)71.88
5DeepSeek V4 Flash (0731) (Max)58.8
6Gemini 3.1 Pro (Preview) (High)58.46
7GLM-5.2 (Max)58.27
8Muse Spark 1.157.23
9Grok 4.5 (High)56.72
10GPT-5.6 Luna (xHigh)51.97
11Claude Sonnet 5 (xHigh)43.14
12Gemini 3.6 Flash (High)41.74
13MiniMax-M340.94
14Claude Opus 531.73
15Gemini 3.5 Flash Lite (High)22.82

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2026-07 · How It Works · Data refreshed daily, snapshot 2026-09-05.