MIST (Selective Trust) — leaderboard

Metric: Overall Accuracy (%). Source: worldbench.github.io. 23 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)94.2
2GPT-5.594.2
3Claude Opus 4.893.7
4Claude Sonnet 4.692.8
5Claude Opus 4.791.1
6Claude Haiku 4.590.1
7Qwen 3 14B89.9
8Phi-4 (Reasoning)88.3
9Qwen 3 8B88.1
10Qwen 2.5 14B85.5
11Seed 1.885.5
12Gemma 3 12B85.4
13Qwen 2.5 7B83.3
14Llama 3.1 8B76
15Qwen 2.5 3B73.4

Interactive version: theaggregate.ai/benchmark?slug=mist-selective-trust · How It Works · Data refreshed daily, snapshot 2026-08-08.