BEAR-Bench: leaderboard

Metric: Overall (%). Source: arxiv.org. 16 models tracked.

Top models

#ModelScore
1Qwen 3.5 397B A17B75.4
2Gemini 3.1 Pro (Preview)75.1
3Gemini 2.5 Pro67.4
4Qwen 3.6 Plus65
5Claude Sonnet 4.662.7
6Claude Opus 4.661.5
7Qwen 3.5 27B60.8
8Gemini 3.1 Flash59.8
9Qwen 3.5 9B49.6
10Gemini 2.5 Flash49
11Qwen 3.5 4B48.6
12Qwen 3 VL 4B (Thinking)34.5
13Qwen 3 VL 8B Instruct25.4
14Gemma 4 31B (IT)23.5
15Qwen 3 VL 2B Instruct14.3

Interactive version: theaggregate.ai/benchmark?slug=bear-bench · How It Works · Data refreshed daily, snapshot 2026-09-05.