Qwen-AgentWorld: leaderboard

Metric: Overall (self-reported). Source: benchmarklist.com. 16 models tracked.

Top models

#ModelScore
1GPT-5.458.25
2Claude Opus 4.657.8
3Claude Opus 4.856.59
4Claude Sonnet 4.656.04
5Qwen 3.5 397B A17B54.74
6Gemini 3.1 Pro (Preview)54.57
7Kimi K2.653.42
8DeepSeek V4 Pro52.97
9Qwen 3.6 Max Preview52.42
10GLM-5.151.31
11Qwen 3.6 Plus50.81
12Qwen 3.5 35B A3B47.73
13MiniMax-M2.746.12
14Qwen 3.6 35B A3B42.88

Interactive version: theaggregate.ai/benchmark?slug=qwen-agentworld · How It Works · Data refreshed daily, snapshot 2026-09-05.