SpecVQA - English Reasoning (L1): leaderboard

Metric: Accuracy (0-1, times 100) on the English reasoning (L1) questions; expert-revised question-answer pairs on 620 spectra (NMR, IR, XRD, Raman, MS, UV-Vis, XPS) from published papers; each answer judged correct or not by GPT-o4-mini against the reference, numeric answers within a 5 percent tolerance; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 20 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)77.59
2Gemini 3 Flash (Preview)77.59
3Gemini 2.5 Pro74.86
4O3 (2025-04-16)71
5Gemini 2.5 Flash70.43
6GPT-569.77
7GPT-5 (Low)69.68
8GPT-5 (High)69.59
9O4 Mini (2025-04-16)68.36
10GPT-5.1 (Non-reasoning)63.47
11GPT-5.2 (Non-reasoning)63.28
12Claude Sonnet 4.5 (Thinking)55.18
13Doubao-Seed-1.6 (Thinking)54.99
14Qwen 3 VL 8B (Thinking)53.48
15Claude Sonnet 4 (Thinking)52.82

Interactive version: theaggregate.ai/benchmark?slug=specvqa-english-reasoning-l1 · How It Works · Data refreshed daily, snapshot 2026-10-07.