FCMBench V1.1 - Validity Checking: leaderboard

Metric: F1 (%). Source: arxiv.org. 28 models tracked.

Top models

#ModelScore
1Gemini 3 Pro87.27
2Gemini 3 Flash73.06
3Qwen 3.5 397B A17B71.87
4Claude Opus 4.571.21
5Kimi K2.566.65
6GLM-4.5V61.16
7Qwen 3 VL 32B Instruct60.8
8GLM-4.6V60.6
9GPT-5.260.05
10Llama 4 Maverick59.78
11GPT-5.159.16
12Qwen 3.5 122B A10B58.04
13Qwen 3 VL 235B A22B Instruct57.37
14Qwen 3 VL 30B A3B Instruct55.36
15Qwen 3.5 35B A3B54.38

Interactive version: theaggregate.ai/benchmark?slug=fcmbench-v1-1-validity-checking · How It Works · Data refreshed daily, snapshot 2026-09-19.