LLM2014 Logic 2025-10 — leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 50 models tracked.

Top models

#ModelScore
1GPT-5 (High)86.25
2GPT-5 Mini (High)79.37
3Grok 474.97
4Claude Sonnet 4.5 (Thinking)69.78
5Qwen 3 235B A22B 2507 (Thinking)54.18
6DeepSeek V3.2 (Thinking)54.16
7GPT-OSS-120B (High)53.24
8Qwen 3 Max52.61
9Gemini 2.5 Pro52.54
10Qwen 3 30B A3B 2507 (Thinking)47.41
11Ring-1T46.07
12Qwen 3 235B A22B 250743.97
13Qwen 3 Next 80B A3B (Thinking)43.77
14Claude Opus 440.23
15GLM-4.6 (Thinking)39.97

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2025-10 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.