LLM2014 Logic 2026-04 — leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 42 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)83.96
2GPT-5.4 (High)79.56
3Claude Opus 4.6 (Thinking)77.23
4Gemini 3.1 Pro (Preview) (High)72.16
5DeepSeek V4 Pro (Max)70.49
6GLM-5.1 (Thinking)64.37
7Gemini 3 Flash (High)58.87
8Kimi K2.6 (Thinking)57.33
9Hy3-preview56.63
10DeepSeek V4 Flash (Max)56.54
11GPT-5.4 Mini (High)52.61
12Claude Opus 4.651.58
13MiniMax-M2.747.37
14Claude Sonnet 4.5 (Thinking)46.89
15Qwen 3.6 Max Preview40.42

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2026-04 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.