Sandboxed Coding Agents are Competitive Omni-m — leaderboard

Metric: OmniGAIA Avg. (self-reported). Source: benchmarklist.com. 12 models tracked.

Top models

#ModelScore
1GPT-5.4 (xHigh)75
2Claude Opus 4.668.6
3Gemini 3.1 Pro (Preview)66.1
4Claude Sonnet 4.663.3
5Gemini 3 Flash (Preview)51.7
6Qwen 3.5 Omni Plus38.7
7MiniMax-M2.733.3
8MiMo-V2-Omni25.8

Interactive version: theaggregate.ai/benchmark?slug=sandboxed-coding-agents-are-competitive-omni-m · How the rankings work · Data refreshed daily, snapshot 2026-07-22.