ReLE - Reasoning - BBH: leaderboard

Metric: Accuracy (%). Source: nonelinear.com. 179 models tracked.

Top models

#ModelScore
1Qwen 3 32B89.9
2Gemini 3.8 Flash87.8
3Gemini 3.1 Pro (Preview)87.5
4Claude Opus 4.686.8
5Gemini 3.5 Flash86
6Claude Opus 586
7Gemini 3.7 Flash85.9
8GPT-4o85.7
9DeepSeek R1 052885.7
10Qwen 3.7 Plus85.7
11Claude Opus 4.8 (Thinking)85.7
12Claude Sonnet 5 (Thinking)85.7
13GLM-5.385.6
14Kimi K385.4
15Doubao-1.5-pro-32k-25011585.2

Interactive version: theaggregate.ai/benchmark?slug=rele-reasoning-bbh · How It Works · Data refreshed daily, snapshot 2026-09-19.