OpenCompass Code - MBPP - English (CompassBench 2404): leaderboard

Metric: Score (%). Source: rank.opencompass.org.cn. 31 models tracked.

Top models

#ModelScore
1GPT-4 Turbo (Preview)77.8
2Qwen-72B-Chat63
3deepseek-llm-7B-chat49.8
4Yi 34B (Chat)47.1
5OrionStar-Yi-34B-Chat46.7
6Baichuan2-13B-Chat40.9
7WizardLM-13B-V1.238.5
8Baichuan2-7B-Chat37.7
9Qwen-7B Chat33.9
10Yi 6B (Chat)31.9
11Llama 2 7B Chat30.4
12Qwen-14B-Chat29.2
13Llama 2 70B Chat24.9
14Llama 2 13B Chat19.8
15Mistral 7B Instruct (v0.2)3.9

Interactive version: theaggregate.ai/benchmark?slug=opencompass-code-mbpp-english-compassbench-2404 · How It Works · Data refreshed daily, snapshot 2026-09-19.