MLX Benchmark V2 - Very Hard — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 21 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.692
2GPT-5.4 Nano82
3Gemini 3 Flash (Preview)76
4Gemma 4 26B A4B (IT)66
5Grok 4.1 Fast60
6DeepSeek V4 Flash52
7Gemini 2.5 Flash Lite (Preview 09-2025)50
8Qwen 3.6 35B A3B36
9GPT-5 Nano34
10DeepSeek V4 Pro29.41
11GLM-5.12
12Kimi K2.50
13Kimi K2.60
14Nemotron 3 Ultra0

Interactive version: theaggregate.ai/benchmark?slug=mlx-benchmark-v2-very-hard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.