BLUEX v2 (Official): leaderboard

Metric: Mean rubric score (0-10; 880 subquestions; evaluation errors score zero). Source: github.com. Saturation forecast: Estimated already saturated. 21 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)9.1
2GPT-5.48.92
3GPT-5 Mini8.9
4Qwen 3.5 122B A10B8.83
5Gemini 3.1 Flash Lite (Preview)8.83
6Qwen 3.5 35B A3B8.77
7Qwen 3.5 27B8.74
8Qwen 3.5 9B8.63
9Gemma 4 26B A4B (IT)8.6
10Qwen 3 14B8.57
11Qwen 3 30B A3B 2507 Instruct8.54
12Mistral Small 48.43
13Qwen 3 8B8.41
14Llama 4 Scout8.1
15Phi-47.09

Interactive version: theaggregate.ai/benchmark?slug=bluex-v2-official · How It Works · Data refreshed daily, snapshot 2026-10-02.