Bug Hunt Bench - LMS: leaderboard

Metric: Planted Bugs Fixed (out of 60). Source: bughunt.productcompass.pm. 69 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (Max)24.5
2Claude Fable 5.1 (Max)24
3GPT-6 (Max)23
4GPT-5.6 Sol (xHigh)21
5GPT-5.6 Sol (High)21
6GPT-6 (xHigh)20
7Muse Spark 1.3 (Max)18
8Claude Fable 5.1 (High)18
9Kimi K317
10Claude Fable 5 (Max)17
11Grok 4.6 (xHigh)17
12GPT-5.6 Luna (Max)16
13GPT-5.6 Terra (Max)16
14Grok 4.6 (High)16
15GPT-5.6 Sol (Medium)16

Interactive version: theaggregate.ai/benchmark?slug=bug-hunt-bench-lms · How It Works · Data refreshed daily, snapshot 2026-09-19.