BBH: leaderboard

Big-Bench Hard benchmark with tasks requiring multi-step reasoning.

Metric: Score (self-reported). Source: benchmarklist.com. Status: saturated. 16 models tracked.

Top models

#ModelScore
1DeepSeek V387.5
2Llama 3.1 405B82.9
3Phi-3-medium-128k-instruct81.4
4Qwen 2.5 72B79.8
5Phi-3-small-8k-instruct79.1
6GPT-4.175.12
7Phi-3 Mini 4K Instruct71.7
8Llama 2 70B Base64.9
9GPT-3.5 Turbo (1106)61.59
10Phi-459.4
11Llama 2 7B58.5
12Mistral-7B-v0.156.1
13gemma-7B55.1
14Qwen 3 235B A22B55
15Yi 6B (Base)47.2

Interactive version: theaggregate.ai/benchmark?slug=bbh · How It Works · Data refreshed daily, snapshot 2026-09-05.