Equational Theories - Hard2 (Default reasoning): leaderboard

Metric: Strict F1 (%). Source: huggingface.co. Saturation forecast: Around January 2027. 25 models tracked.

Top models

#ModelScore
1GPT-5.492.13
2Gemini 3.1 Pro (Preview)90.42
3Grok 4.1 Fast76.43
4Kimi K2.574.53
5Gemini 3 Flash (Preview)73.14
6Qwen 3.5 397B A17B72.94
7GLM-572.21
8GPT-5 Mini71.99
9Qwen 3.5 122B A10B71.78
10Qwen 3.5 27B71.64
11Claude Opus 4.670.86
12GPT-OSS-120B68.61
13Claude Haiku 4.565.55
14Seed 2.0 Lite62.08
15Llama 3.1 8B Instruct58.9

Interactive version: theaggregate.ai/benchmark?slug=equational-theories-hard2-default-reasoning · How It Works · Data refreshed daily, snapshot 2026-10-09.