BIG-Bench Extra Hard: leaderboard

23 reasoning tasks (4,520 items) from Google DeepMind (2025), each a harder replacement for a BIG-Bench Hard task; harmonic mean of per-task accuracy, 9.8% for the best general model at release.

Metric: Score (self-reported). Source: arxiv.org. 17 models tracked.

Top models

#ModelScore
1Gemma 4 31B74.4
2Gemma 4 26B A4B64.8
3Gemma 4 12B Unified53
4o3-mini (high)44.8
5Gemma 4 E4B33.1
6Gemma 4 E2B21.9
7Gemini 2.0 Flash9.8
8Gemini 2.0 Flash-Lite8
9DeepSeek R16.8
10GPT4o6

Interactive version: theaggregate.ai/benchmark?slug=big-bench-extra-hard · How It Works · Data refreshed daily, snapshot 2026-09-05.