LLM2014 Logic 2025-05 — leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 32 models tracked.

Top models

#ModelScore
1O3 (High)85.14
2O4 Mini (High)80.16
3Grok 3 Mini69.06
4Gemini 2.5 Pro (Preview 05-06)68.33
5Claude Sonnet 4 (Thinking)68.22
6Qwen 3 235B A22B (Thinking)66.6
7Claude Opus 460.12
8GPT-4.1 Mini53.52
9Claude Sonnet 452.08
10Qwen 3 30B A3B (Thinking)51.6
11DeepSeek V3 (0324)46.2
12Gemini 2.5 Flash42.85
13Qwen 3 235B A22B40.18
14Gemini 2.5 Flash (Preview 05-20)39.06
15GPT-4.136.62

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2025-05 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.