MLX Benchmark V2 - Debugging — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 21 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.695.24
2Gemini 3 Flash (Preview)80.95
3Grok 4.1 Fast71.43
4Gemma 4 26B A4B (IT)66.67
5GPT-5.4 Nano57.14
6Gemini 2.5 Flash Lite (Preview 09-2025)52.38
7DeepSeek V4 Pro33.33
8Qwen 3.6 35B A3B33.33
9Nemotron 3 Ultra19.05
10GPT-5 Nano14.29
11DeepSeek V4 Flash14.29
12Kimi K2.50
13GLM-5.10
14Kimi K2.60

Interactive version: theaggregate.ai/benchmark?slug=mlx-benchmark-v2-debugging · How the rankings work · Data refreshed daily, snapshot 2026-07-22.