VMMU: leaderboard

Metric: Mean accuracy (%) over the seven domains of 2,548 Vietnamese multiple-choice exam questions, each given as one rendered page image with the question, options and visual evidence (answer letter extracted from curly brackets; random baseline 25.9); higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 17 models tracked.

Top models

#ModelScore
1Gemini 3 Pro86.33
2GPT-5 (Medium)78.41
3Claude Opus 4.6 (Thinking)74.62
4O3 (Medium)73.98
5Gemini 2.5 Flash71.34
6Qwen 2.5 VL 32B Instruct52.13
7Qwen 2.5 VL 72B Instruct51.75
8GPT-4.151.58
9Claude Sonnet 450.58
10Llama 4 Scout49.06
11Gemma 3 27B39.09
12Llama 4 Maverick38.37
13Mistral Medium 337.78
14Mistral Small 3.231.88
15aya-vision-8B25.56

Interactive version: theaggregate.ai/benchmark?slug=vmmu · How It Works · Data refreshed daily, snapshot 2026-09-29.