MMTU - NL-2-code — leaderboard

Metric: Accuracy (%). Source: huggingface.co. 26 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro71.7
2GPT-571.1
3O371.01
4Gemini 2.5 Flash70.7
5GPT-5 Chat70.42
6GPT-5 Mini69.84
7Qwen 3 235B A22B (Thinking)69.45
8Grok 3 Mini68.57
9DeepSeek R1 052868.11
10GPT-OSS-120B66.98
11Qwen 3 235B A22B 2507 Instruct65.39
12Llama 4 Maverick Instruct FP863.73
13GPT-OSS-20B62.34
14Qwen 3 32B61.5
15Qwen 3 8B60.43

Interactive version: theaggregate.ai/benchmark?slug=mmtu-nl-2-code · How the rankings work · Data refreshed daily, snapshot 2026-07-22.