Qwen-AgentWorld — leaderboard

Metric: Avg. (self-reported). Source: benchmarklist.com. 18 models tracked.

Top models

#ModelScore
1GPT-5.458.25
2Claude Opus 4.657.8
3Claude Opus 4.856.59
4Claude Sonnet 4.656.04
5Qwen 3.5 397B A17B54.74
6Gemini 3.1 Pro (Preview)54.57
7DeepSeek V4 Pro52.97
8GLM-5.151.31
9Qwen 3.6 Plus50.81
10Qwen 3.5 35B A3B47.73
11MiniMax-M2.746.12
12Qwen 3.6 35B A3B42.88

Interactive version: theaggregate.ai/benchmark?slug=qwen-agentworld · How the rankings work · Data refreshed daily, snapshot 2026-07-22.