LLM2014 Logic 2025-08 — leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 45 models tracked.

Top models

#ModelScore
1GPT-5 (High)86.57
2GPT-5 Mini (High)81.69
3Grok 478.22
4O3 (High)71.31
5O4 Mini (High)70.22
6GPT-OSS-120B (High)57.79
7Qwen 3 235B A22B 2507 (Thinking)56.93
8DeepSeek V3.1 (Thinking)56.82
9Gemini 2.5 Pro54.58
10DeepSeek R1 052852.1
11Claude Sonnet 4 (Thinking)51.62
12Qwen 3 30B A3B 2507 (Thinking)49.63
13Qwen 3 235B A22B 250747.23
14Claude Opus 443.68
15GLM-4.5 (Thinking)42.18

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2025-08 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.