NOVA-63: leaderboard

Amazon Nova multilingual evaluation covering 63 languages, used to compare broad language understanding and generation quality across those languages.

Metric: Score (%). Source: llm-stats.com. Status: years away from saturation. 11 models tracked.

Top models

#ModelScore
1Qwen 3.5 397B A17B59.1
2Claude Opus 4.6 (Thinking)59.1
3Qwen 3.7 Max59
4Qwen 3.7 Plus58.8
5Qwen 3.5 122B A10B58.6
6Qwen 3.5 27B58.1
7Qwen 3.6 Plus57.9
8Qwen 3.5 35B A3B57.1
9Kimi K2.6 (Thinking)56.7
10Qwen 3.5 9B55.9
11GLM-5.1 (Thinking)54.6
12Qwen 3.5 4B54.3
13DeepSeek V4 Pro (Reasoning, Max Effort)52.8
14Qwen 3.5 2B46.4
15Qwen 3.5 0.8B42.4

Interactive version: theaggregate.ai/benchmark?slug=nova-63 · How It Works · Data refreshed daily, snapshot 2026-09-05.