OccuBench (Clean Environment): leaderboard

Metric: Completion rate (%) over all 382 tasks in the clean environment (E0); 382 tool-use task instances from 100 professional scenarios, the environment simulated by Gemini-3-Flash-Preview and each trajectory passed or failed by a rubric verifier; thinking mode on, high reasoning effort where configurable; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 15 models tracked.

Top models

#ModelScore
1GPT-5.2 (High)79.6
2Gemini 3.1 Pro (Preview)72.3
3Claude Opus 4.6 (High)71.5
4Qwen 3.5 Plus (Thinking)69.9
5DeepSeek V3.2 (Thinking)69.6
6Claude Opus 4.5 (Thinking)65.2
7Claude Sonnet 4.5 (Thinking)64.9
8Claude Sonnet 4.6 (Thinking)64.4
9Kimi K2.5 (Thinking)64.1
10GLM-5 (Thinking)62.6
11Claude Opus 4 (Thinking)61.3
12Qwen 3.5 Flash (Thinking)59.7
13MiniMax-M2.753.9
14Claude Sonnet 4 (Thinking)53.4

Interactive version: theaggregate.ai/benchmark?slug=occubench-clean-environment · How It Works · Data refreshed daily, snapshot 2026-10-07.