LLM2014 Logic 2026-01 — leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 45 models tracked.

Top models

#ModelScore
1GPT-5.2 (High)80.71
2Gemini 3 Pro75.64
3Gemini 3 Flash (High)73.32
4GPT-5 Mini (High)71.43
5Kimi K2.5 (Thinking)65.21
6Grok 463.91
7GLM-4.7 (Thinking)62.94
8Claude Sonnet 4.5 (Thinking)60.83
9Kimi K2 (Thinking)55.69
10Qwen 3 Max (Preview)49.6
11Qwen 3 235B A22B 2507 (Thinking)46.71
12ERNIE 5.041.43
13GPT-OSS-120B (High)38.39
14MiniMax-M2.136.72
15MiMo-V2-Flash (Reasoning)36.56

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2026-01 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.