GeoAux-Bench (Core) - Curriculum Senior: leaderboard

Metric: Accuracy (%) on the 647 senior curriculum questions of GeoAux-Bench-Core (expert-annotated geometry problems needing auxiliary constructions; final answers checked by a Qwen3-30B-A3B-Thinking-2507 verifier; greedy decoding, 8,192 new tokens); higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 21 models tracked.

Top models

#ModelScoreOverall rank
1Gemini 2.5 Pro83.91#145
2Gemini 2.5 Flash80.1#237
3GPT-571.48#91
4Qwen 3 VL 235B A22B (Thinking)64.68#228 (Qwen 3 VL 235B A22B)
5Doubao-Seed-1.6 (Thinking)62.02
6Qwen 3 VL 235B A22B Instruct61.36#264
7Qwen 3 VL 30B A3B Instruct61.36#365
8Claude Opus 4.1 (Thinking)60.36#132 (Claude Opus 4.1)
9Claude Sonnet 4.5 (Thinking)59.2#138 (Claude Sonnet 4.5)
10Qwen 3 VL 30B A3B (Thinking)55.72#338 (Qwen 3 VL 30B A3B)
11GLM-4.5V (Non-reasoning)45.27#339 (GLM-4.5V)
12GLM-4.1V-9B (Thinking)31.67#457 (GLM-4.1V-9B)
13InternVL3-8B25.87#606
14GPT-4o19.57#333

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=geoaux-bench-core-curriculum-senior · How It Works · Data refreshed daily, snapshot 2026-10-11.