LLM2014 Logic 2025-09: leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 46 models tracked.

Top models

#ModelScore
1GPT-5 (High)84.1
2GPT-5 Mini (High)78.12
3Grok 474.79
4Grok 4 Fast (Reasoning)67.59
5DeepSeek V3.1 (Thinking)54.13
6GPT-OSS-120B (High)53.51
7Qwen 3 235B A22B 2507 (Thinking)53.11
8Gemini 2.5 Pro51.65
9Claude Sonnet 4 (Thinking)48.04
10Qwen 3 30B A3B 2507 (Thinking)46.52
11Qwen 3 Next 80B A3B (Thinking)43.59
12Qwen 3 235B A22B 250743.08
13Qwen 3 Max (Preview)42.33
14Claude Opus 440.23
15Kimi K2 090540.01

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2025-09 · How It Works · Data refreshed daily, snapshot 2026-09-05.