GeoAux-Bench (Core) - Olympiad Senior: leaderboard

Metric: Accuracy (%) on the 237 senior olympiad questions of GeoAux-Bench-Core (expert-annotated geometry problems needing auxiliary constructions; final answers checked by a Qwen3-30B-A3B-Thinking-2507 verifier; greedy decoding, 8,192 new tokens); higher is better. Source: arxiv.org. Saturation forecast: Not forecast. 21 models tracked.

Top models

#ModelScoreOverall rank
1Qwen 3 VL 235B A22B (Thinking)89.45#228 (Qwen 3 VL 235B A22B)
2Qwen 3 VL 30B A3B (Thinking)83.97#338 (Qwen 3 VL 30B A3B)
3Gemini 2.5 Pro82.28#145
4GPT-579.32#91
5Qwen 3 VL 235B A22B Instruct78.9#264
6Qwen 3 VL 30B A3B Instruct75.53#365
7Doubao-Seed-1.6 (Thinking)72.57
8GLM-4.5V (Non-reasoning)72.15#339 (GLM-4.5V)
9InternVL3-8B67.93#606
10Gemini 2.5 Flash64.56#237
11Claude Opus 4.1 (Thinking)58.23#132 (Claude Opus 4.1)
12GPT-4o57.38#333
13GLM-4.1V-9B (Thinking)56.12#457 (GLM-4.1V-9B)
14Claude Sonnet 4.5 (Thinking)55.7#138 (Claude Sonnet 4.5)

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=geoaux-bench-core-olympiad-senior · How It Works · Data refreshed daily, snapshot 2026-10-11.