OSWorld-Verified: leaderboard

369 computer-use tasks in a live desktop OS (LibreOffice, GIMP, VS Code, Chrome) from XLANG Lab at HKU; the 2025 Verified revision fixed 300+ task issues. Execution-checked success rate, humans 72%.

Metric: Success rate (self-reported). Source: benchmarklist.com. Status: years away from saturation. 131 models tracked.

Top models

#ModelScore
1Qwen 3.8 Max86.1
2Claude Fable 5 (Max)85
3Qwen 3.8 27B84.3
4Claude Opus 4.883.4
5Gemini 3.6 Flash83
6Claude Opus 4.782.8
7Claude Sonnet 581.2
8Muse Spark 1.180.8
9Claude Mythos Preview79.6
10GPT-5.578.7
11Gemini 3.5 Flash78.4
12Gemini 3.1 Pro (Preview)76.2
13GPT-5.4 (xHigh)75
14Gemini 3.5 Flash Lite74
15Qwen 3.7 Plus73.3

Interactive version: theaggregate.ai/benchmark?slug=osworld-verified · How It Works · Data refreshed daily, snapshot 2026-09-05.