Open Chinese LLM - C-Eval Semantic — leaderboard
Metric: Accuracy (%). Source: huggingface.co. 338 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Qwen 2 72B Instruct | 94.11 |
| 2 | Qwen 2 72B | 93.47 |
| 3 | MultiVerse_70B | 91.53 |
| 4 | Rhea-72B-v0.5 | 91.35 |
| 5 | TW3-JRGL-v2 | 91.28 |
| 6 | free-evo-qwen72B-v0.8-re | 91.21 |
| 7 | Qwen 1.5 72B Chat | 91.14 |
| 8 | Le_Triomphant-ECE-TW3 | 91.1 |
| 9 | ECE-TW3-JRGL-V5 | 90.81 |
| 10 | Qwen 1.5 32B Chat | 90.78 |
| 11 | Smaug-34B-v0.1 | 90.75 |
| 12 | YiSM-blossom5.1-34B-SLERP | 90.64 |
| 13 | Smaug-72B-v0.1 | 90.6 |
| 14 | UNA-SimpleSmaug-34B-v1beta | 90.6 |
| 15 | Yi-34Bx2-MoE-60B-DPO | 90.57 |
Interactive version: theaggregate.ai/benchmark?slug=open-chinese-llm-c-eval-semantic · How the rankings work · Data refreshed daily, snapshot 2026-07-22.