LabBench (Gamow Labs): leaderboard

Metric: Mean share of binary rubric criteria passed (%) over 20 held-out wet-lab decision tasks (406 criteria), one run per task in each vendor's harness, judged by Codex with GPT-5.6 Sol. Source: gamowlabs.com. Saturation forecast: Around 2029. 5 models tracked.

Top models

#ModelScore
1GPT-640.8
2Claude Opus 5.5 (Max)40.5
3Grok 4.729.6
4Muse Spark 1.3 (High)28.2
5Gemini 3.8 Flash18.4

Interactive version: theaggregate.ai/benchmark?slug=labbench-gamow-labs · How It Works · Data refreshed daily, snapshot 2026-10-01.