OpenAI HumanEval — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 12 models tracked.

Top models

#ModelScore
1O4 Mini (2025-04-16)98.78
2Claude 3.7 Sonnet (20250219)92.68
3GPT-4o (2024-08-06)92.07
4Gemini 2.0 Flash (001)87.8
5GPT-4o Mini (2024-07-18)87.2
6DeepSeek V3 Chat85.37
7mistral-large-latest82.93
8mistral-small-latest82.32
9Qwen 2.5 Coder 32B Instruct79.27
10Llama 3.2 90B Vision Instruct76.83
11Llama 3.3 70B Instruct72.56

Interactive version: theaggregate.ai/benchmark?slug=openai-humaneval · How the rankings work · Data refreshed daily, snapshot 2026-07-22.