ChartArena - Line Chart (Chinese): leaderboard

Metric: mAP-high (%) on Chinese line charts, each model parses the chart image into its native structured format, normalized format-agnostically to (header, entity, value) triples for numeric charts or to labeled graphs and trees for flowcharts and mind maps; mean average precision over similarity thresholds at the high tolerance level, averaged over three visual styles (digital renderings, printed photos, hand-drawn photos); higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 43 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)85.3
2Seed 2.0 Pro (Non-reasoning)80.7
3Kimi K2.5 (Non-reasoning)79.8
4Gemini 2.5 Pro77.6
5Qwen 3.5 35B A3B (Thinking)77.6
6Gemma 4 31B (IT)76.4
7Qwen 3 VL 235B A22B Instruct73.8
8GLM-4.5V70.5
9Qwen 2.5 VL 72B Instruct66.7
10MiMo-V2-Omni66.4
11GPT-565.1
12Qwen 3 VL 8B (Thinking)64.9
13Qwen 3 VL 8B Instruct61.1
14Qwen 3 VL 4B (Thinking)57.9
15Qwen 3 VL 4B Instruct57

Interactive version: theaggregate.ai/benchmark?slug=chartarena-line-chart-chinese · How It Works · Data refreshed daily, snapshot 2026-09-29.