OpenCompass Code - MBPP - Chinese (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)63.2
2Qwen-72B-Chat46.2
3Yi 34B (Chat)37
4OrionStar-Yi-34B-Chat34.8
5deepseek-llm-7B-chat31.4
6Baichuan2-13B-Chat27.8
7Qwen-14B-Chat27.6
8Qwen-7B Chat27
9Yi 6B (Chat)24.8
10Llama 2 13B Chat22.2
11Baichuan2-7B-Chat20.8
12Llama 2 7B Chat17.8
13Llama 2 70B Chat12.8
14WizardLM-70B-V1.010.6
15WizardLM-13B-V1.28.8

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-mbpp-chinese-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.