MLX Benchmark V2 - Hard — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.692.66
2Gemini 3 Flash (Preview)77.78
3Qwen 3.6 Max Preview75
4GPT-5.4 Nano72.48
5DeepSeek V4 Flash72.48
6Gemma 4 26B A4B (IT)68.81
7DeepSeek V4 Pro65.56
8Grok 4.1 Fast65.14
9Gemini 2.5 Flash Lite (Preview 09-2025)64.22
10Qwen 3.6 35B A3B52.29
11GPT-5 Nano41.28
12Nemotron 3 Ultra12.84
13GLM-5.111.01
14Kimi K2.55.5
15Kimi K2.64.63

Interactive version: theaggregate.ai/benchmark?slug=mlx-benchmark-v2-hard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.