GeoAux-Bench (Core) - Olympiad Junior: leaderboard

Metric: Accuracy (%) on the 207 junior olympiad questions of GeoAux-Bench-Core (expert-annotated geometry problems needing auxiliary constructions; final answers checked by a Qwen3-30B-A3B-Thinking-2507 verifier; greedy decoding, 8,192 new tokens); higher is better. Source: arxiv.org. Saturation forecast: Not forecast. 21 models tracked.

Top models

#ModelScoreOverall rank
1Qwen 3 VL 235B A22B (Thinking)95.17#228 (Qwen 3 VL 235B A22B)
2Qwen 3 VL 30B A3B (Thinking)93.24#338 (Qwen 3 VL 30B A3B)
3Qwen 3 VL 235B A22B Instruct91.79#264
4Qwen 3 VL 30B A3B Instruct89.37#365
5GPT-588.41#91
6Gemini 2.5 Pro88.24#145
7Doubao-Seed-1.6 (Thinking)86.47
8GLM-4.5V (Non-reasoning)82.61#339 (GLM-4.5V)
9Gemini 2.5 Flash82.13#237
10Claude Sonnet 4.5 (Thinking)60.39#138 (Claude Sonnet 4.5)
11Claude Opus 4.1 (Thinking)58.45#132 (Claude Opus 4.1)
12InternVL3-8B55.56#606
13GLM-4.1V-9B (Thinking)53.14#457 (GLM-4.1V-9B)
14GPT-4o42.51#333

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=geoaux-bench-core-olympiad-junior · How It Works · Data refreshed daily, snapshot 2026-10-11.