LLM Stats (CharXiv-D) — leaderboard
Metric: Score (%). Source: llm-stats.com. 16 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Seed 2.1 Pro | 95.5 |
| 2 | Qwen 3 VL 32B Instruct | 90.5 |
| 3 | Qwen 3 VL 32B (Thinking) | 90.2 |
| 4 | GPT-4.5 | 90 |
| 5 | GPT-4.1 Mini | 88.4 |
| 6 | Command A+ | 88 |
| 7 | GPT-4.1 | 87.9 |
| 8 | Qwen 3 VL 30B A3B (Thinking) | 86.9 |
| 9 | Qwen 3 VL 8B (Thinking) | 85.9 |
| 10 | Qwen 3 VL 30B A3B Instruct | 85.5 |
| 11 | GPT-4o | 85.3 |
| 12 | Qwen 3 VL 4B (Thinking) | 83.9 |
| 13 | Qwen 3 VL 8B Instruct | 83 |
| 14 | Qwen 3 VL 4B Instruct | 76.2 |
| 15 | GPT-4.1 Nano | 73.9 |
Interactive version: theaggregate.ai/benchmark?slug=llm-stats-charxiv-d · How the rankings work · Data refreshed daily, snapshot 2026-07-22.