Sandboxed Coding Agents are Competitive Omni-m: leaderboard

Metric: OmniGAIA Avg. (self-reported). Source: benchmarklist.com. 16 models tracked.

Top models

#ModelScore
1GPT-5.4 (xHigh)75
2Claude Opus 4.668.6
3Gemini 3.1 Pro (Preview)66.1
4GPT-5.4 (High)64.4
5Claude Sonnet 4.663.3
6GPT-5.4 (Medium)56.4
7GPT-5.4 (Low)55
8Gemini 3 Flash51.7
9Qwen 3.5 Omni Plus38.7
10MiniMax-M2.733.3
11MiMo-V2-Omni25.8

Interactive version: theaggregate.ai/benchmark?slug=sandboxed-coding-agents-are-competitive-omni-m · How It Works · Data refreshed daily, snapshot 2026-09-05.