Open Chinese LLM - C-Eval Semantic — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 338 models tracked.

Top models

#ModelScore
1Qwen 2 72B Instruct94.11
2Qwen 2 72B93.47
3MultiVerse_70B91.53
4Rhea-72B-v0.591.35
5TW3-JRGL-v291.28
6free-evo-qwen72B-v0.8-re91.21
7Qwen 1.5 72B Chat91.14
8Le_Triomphant-ECE-TW391.1
9ECE-TW3-JRGL-V590.81
10Qwen 1.5 32B Chat90.78
11Smaug-34B-v0.190.75
12YiSM-blossom5.1-34B-SLERP90.64
13Smaug-72B-v0.190.6
14UNA-SimpleSmaug-34B-v1beta90.6
15Yi-34Bx2-MoE-60B-DPO90.57

Interactive version: theaggregate.ai/benchmark?slug=open-chinese-llm-c-eval-semantic · How the rankings work · Data refreshed daily, snapshot 2026-07-22.