LLM2014 Logic 2026-02 — leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 46 models tracked.

Top models

#ModelScore
1Claude Opus 4.6 (Thinking)78.02
2GPT-5.2 (High)76.82
3Gemini 3.1 Pro (Preview)75.02
4Gemini 3 Pro68.14
5GPT-5 Mini (High)67.84
6Gemini 3 Flash (High)66.09
7Kimi K2.5 (Thinking)60.75
8Grok 458.51
9GLM-5 (Thinking)55.87
10Qwen 3.5 Plus (Thinking)53.8
11Claude Sonnet 4.5 (Thinking)52.81
12Claude Opus 4.651.55
13MiniMax-M2.549.36
14Step 3.5 Flash42.77
15Qwen 3 235B A22B 2507 (Thinking)37.74

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2026-02 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.