LLM2014 Logic 2026-03: leaderboard

Metric: Median Score. Source: raw.githubusercontent.com. 42 models tracked.

Top models

#ModelScore
1GPT-5.4 (High)78.85
2Claude Opus 4.6 (Thinking)77.23
3Gemini 3.1 Pro (Preview) (High)75.02
4Seed 2.0 Pro (High)68.36
5Gemini 3 Flash (High)65.29
6Kimi K2.5 (Thinking)59.56
7GLM-5 (Thinking)55.08
8GPT-5.4 Mini (High)54.45
9Claude Opus 4.653.93
10Claude Sonnet 4.5 (Thinking)52.81
11Qwen 3.5 Plus (Thinking)51.81
12MiniMax-M2.749.52
13Step 3.5 Flash39.99
14Qwen 3.5 Plus39.29
15LongCat-Flash-Thinking-260137.69

Interactive version: theaggregate.ai/benchmark?slug=llm2014-logic-2026-03 · How It Works · Data refreshed daily, snapshot 2026-09-05.