Facet-Probe - Image Set Order: leaderboard

Metric: Flip rate (% of items whose normalized answer changes across six sampled orderings of multi-image inputs (Mantis-Eval and MedFrameQA, position-reference-screened); lower is better). Source: arxiv.org. Saturation forecast: Around December 2026. 18 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)10
2Claude Opus 4.7 (Thinking)13
3Gemini 3 Flash (Preview)14
4GPT-5.5 (Medium)15
5MedGemma-4B-IT19
6Qwen 3.5 9B20
7Claude Sonnet 4.6 (Thinking)21
8GPT-5.4 Mini (Medium)31
9Qwen 3.5 4B33
10Qwen 3.5 0.8B35
11Qwen 3.5 2B58

Interactive version: theaggregate.ai/benchmark?slug=facet-probe-image-set-order · How It Works · Data refreshed daily, snapshot 2026-09-26.