Chinese Classical Bench - Char-Gloss Judge — leaderboard

Metric: Score (%). Source: huggingface.co. 10 models tracked.

Top models

#ModelScore
1Claude Opus 4.7 (Thinking)73.6
2Claude Opus 4.771.6
3MiniMax-M2.169.49
4Claude Sonnet 4.669.4
5MiniMax-M2.565.38
6GLM-563.8
7Qwen 3.5 35B A3B62
8Qwen3 Coder Next60.2
9Claude Haiku 4.5 (20251001)57.78
10DeepSeek V3.253.8

Interactive version: theaggregate.ai/benchmark?slug=chinese-classical-bench-char-gloss-judge · How the rankings work · Data refreshed daily, snapshot 2026-07-22.