Equational Theories Benchmark: leaderboard

Metric: F1 (%, mean of six settings). Source: huggingface.co. 25 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)87.02
2Qwen 3.5 122B A10B76.03
3Qwen 3.5 397B A17B75.74
4GPT-5 Mini70.12
5Qwen 3.5 27B70.11
6GPT-OSS-120B68.59
7Seed 2.0 Lite64.5
8Claude Sonnet 4.660.95
9Claude Opus 4.660.7
10Gemini 3 Flash (Preview)60.22
11Kimi K2.557.24
12GLM-552.77
13GPT-5.452.12
14Grok Code Fast 147.34
15Grok 4.1 Fast46.88

Interactive version: theaggregate.ai/benchmark?slug=equational-theories-benchmark · How It Works · Data refreshed daily, snapshot 2026-09-05.