Disentangling Language Roles in Multilingual L — leaderboard

Metric: JointSuccess (self-reported). Source: benchmarklist.com. 20 models tracked.

Top models

#ModelScore
1Qwen 3.5 Plus (2026-04-20)82
2GPT-5.4 Mini81.5
3GPT-5.479.9
4DeepSeek V3.279.6
5DeepSeek V3.178.6
6GPT-5.3 Codex78.1
7Claude Sonnet 4.676.7
8Gemini 2.5 Flash Lite76.7
9qwen3.5-flash76.5
10GPT-4.175.8
11Claude Opus 4.174.1
12Llama 3.3 70B Instruct74
13Gemini 2.5 Flash72.7
14MiniMax-M2.771.9
15MiniMax-M2.568.1

Interactive version: theaggregate.ai/benchmark?slug=disentangling-language-roles-in-multilingual-l · How the rankings work · Data refreshed daily, snapshot 2026-07-22.