InfiBench — leaderboard

Metric: Score (%). Source: infi-coder.github.io. 106 models tracked.

Top models

#ModelScore
1GPT-4 (0613)70.64
2GPT-4 Turbo (Preview)68.42
3GPT-4o (2024-05-13)66.19
4Claude 3 Opus63.89
5Mistral Large58.22
6Claude 3 Sonnet58.2
7Claude 3 Haiku57.57
8deepseek-llm-67B-chat57.41
9GPT-3.5 Turbo (0613)56.47
10Mistral Small55.62
11Mixtral 8x7B Instruct55.55
12deepseek-coder-6.7B-instruct53.25
13WizardCoder-Python-34B-V1.052.59
14CodeLlama-34B-Instruct50.45
15Yi 34B (Chat)49.58

Interactive version: theaggregate.ai/benchmark?slug=infibench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.