VibeCodingBench — leaderboard

Production-oriented coding benchmark evaluating AI coding agents across functional correctness, visual fidelity, code quality, security, cost, and speed on representative developer tasks.

Metric: Average Score. Source: github.com. 15 models tracked.

Top models

#ModelScore
1Claude Opus (Claude Opus 4.5)89.15
2Claude Haiku (Claude Haiku 4.5)88.97
3Grok (Grok 4 Fast)88.8
4OpenAI (OpenAI GPT-5.2)88.75
5Qwen (Qwen3 Max)88.6
6Claude (Claude Sonnet 4.5)88.56
7GLM-4 (GLM 4-Plus)88.2
8DeepSeek (DeepSeek v3.2)88.19
9Grok (Grok 4)88
10MiniMax (MiniMax M2.1)87.42

Interactive version: theaggregate.ai/benchmark?slug=vibecodingbench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.