Disentangling Language Roles in Multilingual L: leaderboard

Metric: JointSuccess (self-reported). Source: benchmarklist.com. 20 models tracked.

Top models

#ModelScore
1Qwen 3 Max84
2DeepSeek R182.2
3Qwen 3.5 Plus82
4GPT-5.4 Mini81.5
5GPT-5.479.9
6DeepSeek V3.279.6
7DeepSeek V3.178.6
8GPT-5.3 Codex78.1
9Claude Sonnet 4.676.7
10Gemini 2.5 Flash Lite76.7
11Qwen 3.5 Flash76.5
12GPT-4.175.8
13Claude Opus 4.174.1
14Llama 3.3 70B74
15Gemini 2.5 Flash72.7

Interactive version: theaggregate.ai/benchmark?slug=disentangling-language-roles-in-multilingual-l · How It Works · Data refreshed daily, snapshot 2026-09-05.