MLX Benchmark V2 - QA — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 22 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.689.35
2Gemini 3 Flash (Preview)84.4
3Qwen 3.6 Max Preview79.85
4Gemma 4 26B A4B (IT)76.39
5GPT-5.4 Nano76.39
6DeepSeek V4 Flash75.93
7DeepSeek V4 Pro75.5
8Grok 4.1 Fast73.15
9Gemini 2.5 Flash Lite (Preview 09-2025)68.75
10Qwen 3.6 35B A3B53.24
11GPT-5 Nano44.44
12GLM-5.117.59
13Nemotron 3 Ultra13.66
14Kimi K2.50.69
15Kimi K2.60.47

Interactive version: theaggregate.ai/benchmark?slug=mlx-benchmark-v2-qa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.