LLM2014 Logic 2026-03 — leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 42 models tracked.

Top models

#ModelScore
1GPT-5.4 (High)78.85
2Claude Opus 4.6 (Thinking)77.23
3Gemini 3.1 Pro (Preview) (High)75.02
4Gemini 3 Flash (High)65.29
5Kimi K2.5 (Thinking)59.56
6GLM-5 (Thinking)55.08
7GPT-5.4 Mini (High)54.45
8Claude Opus 4.653.93
9Claude Sonnet 4.5 (Thinking)52.81
10Qwen 3.5 Plus (Thinking)51.81
11MiniMax-M2.749.52
12Step 3.5 Flash39.99
13Qwen 3.5 Plus39.29
14LongCat-Flash-Thinking-260137.69
15MiMo-V2-Pro34.22

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2026-03 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.