MLX Benchmark V2 - Conceptual — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 21 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.692.31
2Gemma 4 26B A4B (IT)92.31
3Gemini 3 Flash (Preview)92.31
4GPT-5.4 Nano92.31
5DeepSeek V4 Flash84.62
6Grok 4.1 Fast84.62
7DeepSeek V4 Pro76.92
8Gemini 2.5 Flash Lite (Preview 09-2025)69.23
9GPT-5 Nano61.54
10Qwen 3.6 35B A3B53.85
11Nemotron 3 Ultra30.77
12GLM-5.17.69
13Kimi K2.50
14Kimi K2.60

Interactive version: theaggregate.ai/benchmark?slug=mlx-benchmark-v2-conceptual · How the rankings work · Data refreshed daily, snapshot 2026-07-22.