FaulT-Bench - Wrong-Device Tickets - Reasoning Score: leaderboard
Metric: Judged reasoning score (0-1; grounding, causality and coverage, answered runs). Source: arxiv.org. 3 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude Code + claude-sonnet-4-6 | 0.96 |
| 2 | SADE + claude-sonnet-4-6 | 0.94 |
| 3 | NIKA ReAct + gpt-5 | 0.87 |
Interactive version: theaggregate.ai/benchmark?slug=fault-bench-wrong-device-tickets-reasoning-score · How It Works · Data refreshed daily, snapshot 2026-09-19.