MM-JudgeBias: leaderboard

Metric: Mean judge-reliability score (0 to 1) over nine bias types MM-JudgeBias (about 200 image-query-response triplets per bias type, 1,804 in all, each judged on a 1-10 scale before and after a controlled perturbation; mean of three runs): Bias-Deviation (normalized score drop when the image or query is removed or mismatched) for five types and Bias-Conformity (score invariance under meaning-preserving perturbations) for four; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 30 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro0.87
2Gemini 3 Pro (High)0.87
3Claude Opus 4.5 (Thinking)0.86
4Claude Sonnet 4.5 (Thinking)0.82
5Claude Opus 4.50.82
6Gemini 2.5 Flash0.76
7Claude Haiku 4.5 (Thinking)0.76
8Claude Sonnet 4.50.75
9Gemini 2.5 Flash Lite (Thinking)0.75
10Qwen 3 VL 8B Instruct0.74
11Qwen 3 VL 30B A3B (Thinking)0.71
12Claude Haiku 4.50.71
13Qwen 3 VL 30B A3B Instruct0.68
14O3 (High)0.68
15Gemini 2.5 Flash Lite0.67

Interactive version: theaggregate.ai/benchmark?slug=mm-judgebias · How It Works · Data refreshed daily, snapshot 2026-10-07.