GeoAux-Bench (Core) - Curriculum Junior: leaderboard

Metric: Accuracy (%) on the 1,288 junior curriculum questions of GeoAux-Bench-Core (expert-annotated geometry problems needing auxiliary constructions; final answers checked by a Qwen3-30B-A3B-Thinking-2507 verifier; greedy decoding, 8,192 new tokens); higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 21 models tracked.

Top models

#ModelScoreOverall rank
1Gemini 2.5 Pro84.75#145
2GPT-584.02#91
3Gemini 2.5 Flash81.68#237
4Qwen 3 VL 235B A22B Instruct77.8#264
5Qwen 3 VL 30B A3B Instruct70.38#365
6Doubao-Seed-1.6 (Thinking)61.42
7Claude Opus 4.1 (Thinking)52.7#132 (Claude Opus 4.1)
8Claude Sonnet 4.5 (Thinking)52#138 (Claude Sonnet 4.5)
9Qwen 3 VL 235B A22B (Thinking)50.36#228 (Qwen 3 VL 235B A22B)
10Qwen 3 VL 30B A3B (Thinking)49.64#338 (Qwen 3 VL 30B A3B)
11InternVL3-8B30.02#606
12GLM-4.5V (Non-reasoning)24.62#339 (GLM-4.5V)
13GPT-4o24.29#333
14GLM-4.1V-9B (Thinking)23.57#457 (GLM-4.1V-9B)

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=geoaux-bench-core-curriculum-junior · How It Works · Data refreshed daily, snapshot 2026-10-11.