MLX Benchmark V2 - Easy — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.691.67
2Qwen 3.6 Max Preview85.27
3Gemini 3 Flash (Preview)83.62
4DeepSeek V4 Pro77.78
5DeepSeek V4 Flash76.67
6GPT-5.4 Nano75
7Grok 4.1 Fast75
8Gemma 4 26B A4B (IT)74.44
9Gemini 2.5 Flash Lite (Preview 09-2025)69.44
10Qwen 3.6 35B A3B63.33
11GPT-5 Nano37.22
12GLM-5.129.44
13Nemotron 3 Ultra21.67
14Kimi K2.55.56
15Kimi K2.63.33

Interactive version: theaggregate.ai/benchmark?slug=mlx-benchmark-v2-easy · How the rankings work · Data refreshed daily, snapshot 2026-07-22.