Equational Theories - Hard (Low-or-none reasoning): leaderboard

Metric: Strict F1 (%). Source: huggingface.co. Saturation forecast: Not forecast. 25 models tracked.

Top models

#ModelScore
1Qwen 3.5 122B A10B59.14
2Gemini 3.1 Pro (Preview)58.61
3GPT-OSS-120B56.97
4Qwen 3.5 27B56.68
5Qwen 3.5 397B A17B56.1
6Claude Opus 4.653.9
7GPT-5 Mini51.91
8Claude Sonnet 4.650
9Grok Code Fast 145.07
10Gemini 3 Flash (Preview)40.65
11Seed 2.0 Lite38.71
12Llama 3.1 8B Instruct33.47
13Claude Haiku 4.527.48
14GPT-5 Nano26.93
15MiniMax-M2.519.75

Interactive version: theaggregate.ai/benchmark?slug=equational-theories-hard-low-or-none-reasoning · How It Works · Data refreshed daily, snapshot 2026-10-09.