AgentMeter - Task Quality: leaderboard
Metric: Task quality: mean evaluator reward (0-1; 30-task Core Subset of Terminal-Bench, SkillsBench and DA-Code tasks, 10 per effort stratum, one run per LM-CLI configuration, partial credit kept). Source: arxiv.org. Saturation forecast: Rough model projection: around 2026. 28 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude Sonnet 4.6 (Claude Code) | 0.59 |
Interactive version: theaggregate.ai/benchmark?slug=agentmeter-task-quality · How It Works · Data refreshed daily, snapshot 2026-09-26.