TriageBench: leaderboard

Metric: Decision Accuracy (%). Source: labs.logarith.ms. 29 models tracked.

Top models

#ModelScore
1Claude Opus 4.845
2Qwen 3.5 Plus (2026-04-20)44
3Claude Opus 543
4Gemini 3.1 Pro (Preview)42
5GPT-5.6 Sol42
6Qwen 3.7 Plus41
7Qwen 3.8 Max41
8Claude Opus 4.740
9Claude Sonnet 540
10GPT-5.6 Sol (Max)40
11Muse Spark 1.1 (xHigh)40
12GPT-5.539
13GPT-5.439
14GPT-5.6 Luna39
15GPT-5.6 Terra (Max)39

Interactive version: theaggregate.ai/benchmark?slug=triagebench · How It Works · Data refreshed daily, snapshot 2026-09-19.