LabOSBench - Measurement Configuration: leaderboard

Metric: Subtask Success Rate (%; mean over the category's operation-level subtasks, 2 runs each). Source: arxiv.org. Saturation forecast: Around August 2028. 9 models tracked.

Top models

#ModelScore
1GPT-5.581.5
2Seed-1.666.7
3uitars-1.5-7B64.8
4Claude Sonnet 4.563
5Claude Opus 4.563
6Kimi K2.553.7

Interactive version: theaggregate.ai/benchmark?slug=labosbench-measurement-configuration · How It Works · Data refreshed daily, snapshot 2026-09-25.