LLM2014 Logic 2025-06 — leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 38 models tracked.

Top models

#ModelScore
1O3 (High)83.95
2O4 Mini (High)78.97
3Gemini 2.5 Pro71.36
4DeepSeek R1 052866.99
5Qwen 3 235B A22B (Thinking)63.05
6Claude Sonnet 4 (Thinking)62.96
7Grok 3 Mini60.72
8Gemini 2.5 Flash (Thinking)55.46
9Claude Opus 453.48
10Qwen 3 32B (Thinking)50.72
11GPT-4.1 Mini48.53
12Qwen 3 30B A3B (Thinking)47.41
13Claude Sonnet 445.97
14MiniMax-M143.83
15DeepSeek V3 (0324)42.53

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2025-06 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.