MMTU - Data Cleaning — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 26 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro54.57
2O351.75
3GPT-551.05
4GPT-5 Mini49.22
5GPT-5 Chat45.64
6GPT-4o (2024-11-20)44.55
7Gemini 2.5 Flash43.7
8Qwen 3 235B A22B 2507 Instruct42.6
9Grok 3 Mini41.93
10Llama 4 Maverick Instruct FP840.2
11DeepSeek R1 052839.93
12Llama 3.3 70B38.64
13Mistral Large 2 (Nov) Instruct (2411)37.31
14Qwen 3 32B33.8
15Qwen 3 8B32.63

Interactive version: theaggregate.ai/benchmark?slug=mmtu-data-cleaning · How the rankings work · Data refreshed daily, snapshot 2026-07-22.