Vector Eval - HumanEval: leaderboard

Metric: Mean Score (%). Source: huggingface.co. 12 models tracked.

Top models

#ModelScore
1O3 Mini98.17
2O196.95
3DeepSeek R195.68
4Claude 3.5 Sonnet94.51
5Qwen3 Coder Next91.46
6GPT-4o90.85
7Gemini 1.5 Pro87.2
8Mistral Large 2 (Jul)86.59
9GPT-4o Mini85.98
10Llama 3.1 70B Instruct78.66
11Gemini 1.5 Flash74.39
12Command-R+62.2

Interactive version: theaggregate.ai/benchmark?slug=vector-eval-humaneval · How It Works · Data refreshed daily, snapshot 2026-09-05.