Chinese Classical Bench - Punctuate Punct F1 — leaderboard

Metric: Score (%). Source: huggingface.co. 10 models tracked.

Top models

#ModelScore
1Claude Opus 4.780.02
2GLM-579.88
3Claude Opus 4.7 (Thinking)78.99
4Claude Sonnet 4.678.53
5Qwen3 Coder Next76.69
6Qwen 3.5 35B A3B75.31
7DeepSeek V3.274.46
8Claude Haiku 4.5 (20251001)72.87
9MiniMax-M2.570.86
10MiniMax-M2.170.85

Interactive version: theaggregate.ai/benchmark?slug=chinese-classical-bench-punctuate-punct-f1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.