GeoAux-Bench (Core): leaderboard

Metric: Accuracy (%) on all 2,379 questions of GeoAux-Bench-Core (expert-annotated geometry problems needing auxiliary constructions; final answers checked by a Qwen3-30B-A3B-Thinking-2507 verifier; greedy decoding, 8,192 new tokens); higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 21 models tracked.

Top models

#ModelScoreOverall rank
1Gemini 2.5 Pro83.16#145
2GPT-580.62#91
3Gemini 2.5 Flash79.53#237
4Qwen 3 VL 235B A22B Instruct74.85#264
5Qwen 3 VL 30B A3B Instruct70.25#365
6Doubao-Seed-1.6 (Thinking)65
7Qwen 3 VL 235B A22B (Thinking)62.25#228 (Qwen 3 VL 235B A22B)
8Qwen 3 VL 30B A3B (Thinking)58.75#338 (Qwen 3 VL 30B A3B)
9Claude Opus 4.1 (Thinking)55.82#132 (Claude Opus 4.1)
10Claude Sonnet 4.5 (Thinking)55.03#138 (Claude Sonnet 4.5)
11GLM-4.5V (Non-reasoning)40.24#339 (GLM-4.5V)
12InternVL3-8B35.17#606
13GLM-4.1V-9B (Thinking)31.76#457 (GLM-4.1V-9B)
14GPT-4o28.13#333

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=geoaux-bench-core · How It Works · Data refreshed daily, snapshot 2026-10-11.