MMM-Bench - Level 2 (Business Object): leaderboard

Metric: Macro-F1 (%) at taxonomy level 2 (Business Object), zero-shot hierarchical classification of the test split (20 percent of 5,990 real Alibaba business documents in 12 domains, mostly Chinese) from OCR text, page images and filename against a flattened five-level taxonomy, temperature 0.1; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 15 models tracked.

Top models

#ModelScore
1Claude Opus 4.681.89
2Gemini 3.1 Pro (Preview)79.94
3Claude Opus 4.579.67
4GPT-5.478.11
5Qwen 3.6 Plus77.38
6Kimi K2.576.62
7MiniMax-M2.776.14
8Qwen 3.5 27B76.1
9GPT-5.275.97
10GLM-574.23
11Qwen 3 VL 235B A22B71.83
12Qwen 3.5 35B A3B70.4
13Qwen 3.5 9B67.09
14Qwen 2.5 VL 7B18.75

Interactive version: theaggregate.ai/benchmark?slug=mmm-bench-level-2-business-object · How It Works · Data refreshed daily, snapshot 2026-10-07.