SoundnessBench: leaderboard

Metric: Macro-F1 (%; high vs low soundness of 1,099 results-masked ICLR proposals, standard prompt). Source: arxiv.org. Saturation forecast: Around March 2027. 12 models tracked.

Top models

#ModelScore
1GPT-5.469.7
2Claude Sonnet 4.665.3
3GPT-5.4 Mini63.8
4Claude Opus 4.660.5
5Gemini 3.1 Pro (Preview)58.4
6Qwen 3.5 122B A10B56.3
7Qwen 3.5 27B55.1
8Gemini 3 Flash54.5
9Gemini 2.5 Pro49.8
10GPT-4o42.3
11Llama 3.3 70B Instruct38.9

Interactive version: theaggregate.ai/benchmark?slug=soundnessbench · How It Works · Data refreshed daily, snapshot 2026-09-25.