Chinese Classical Bench - Translate Judge — leaderboard

Metric: Score (%). Source: huggingface.co. 10 models tracked.

Top models

#ModelScore
1Claude Opus 4.7 (Thinking)80.2
2Claude Opus 4.780
3Claude Sonnet 4.677.6
4DeepSeek V3.275.4
5GLM-574.8
6Qwen3 Coder Next74.6
7Qwen 3.5 35B A3B72.8
8MiniMax-M2.570.4
9MiniMax-M2.170.4
10Claude Haiku 4.5 (20251001)67.55

Interactive version: theaggregate.ai/benchmark?slug=chinese-classical-bench-translate-judge · How the rankings work · Data refreshed daily, snapshot 2026-07-22.