LLM2014 Logic 2026-04: leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 42 models tracked.

Top models

#ModelScore
1GPT-5.5 (xHigh)83.96
2GPT-5.4 (High)79.56
3Claude Opus 4.6 (Thinking)77.23
4Gemini 3.1 Pro (Preview) (High)72.16
5DeepSeek V4 Pro (Max)70.49
6Seed 2.0 Pro (High)66.02
7GLM-5.1 (Thinking)64.37
8Gemini 3 Flash (High)58.87
9Kimi K2.6 (Thinking)57.33
10Hy3-preview56.63
11DeepSeek V4 Flash (Max)56.54
12GPT-5.4 Mini (High)52.61
13Claude Opus 4.651.58
14MiniMax-M2.747.37
15Claude Sonnet 4.5 (Thinking)46.89

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2026-04 · How It Works · Data refreshed daily, snapshot 2026-09-05.