FCMBench V1.1 - Rationality Review: leaderboard

Metric: F1 (%). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1Gemini 3 Pro69.56
2Kimi K2.568.31
3Gemini 3 Flash62.82
4Claude Opus 4.562.02
5Qwen 3 VL 32B Instruct54.65
6Qwen 3 VL 30B A3B Instruct51.59
7Qwen 3 VL 8B Instruct51.24
8Qwen 3.5 122B A10B50.45
9Qwen 3 VL 235B A22B Instruct49.97
10GPT-5.249.1
11Qwen 3.5 35B A3B48.18
12Qwen 3.5 397B A17B45.8
13Phi-4 Multimodal Instruct45.8
14GLM-4.5V45.56
15GPT-5.143.98

Interactive version: theaggregate.ai/benchmark?slug=fcmbench-v1-1-rationality-review · How It Works · Data refreshed daily, snapshot 2026-09-19.