InfiBench: leaderboard

Metric: Score (%). Source: infi-coder.github.io. 106 models tracked.

Top models

#ModelScore
1GPT-4 (0613)70.64
2GPT-4 Turbo (Preview)68.42
3GPT-4o (2024-05-13)66.19
4Mistral Large58.22
5GPT-3.5 Turbo (0613)56.47
6Mistral Small55.62
7Yi 34B (Chat)49.58
8zephyr-7B-beta46.31
9Qwen-14B43.69
10Qwen-14B-Chat43.49
11Mistral Medium40.95
12gemma-7B (IT)40.68
13Yi 6B (Chat)38.14
14Qwen-7B Chat37.36
15Qwen-7B31.69

Interactive version: theaggregate.ai/benchmark?slug=infibench · How It Works · Data refreshed daily, snapshot 2026-09-05.