CATTest - Bug Discovery P-score: leaderboard

Metric: P-score (0-100; precision-oriented bug reporting). Source: arxiv.org. 17 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)48.56
2Claude Opus 4.648.2
3GPT-5.546.88
4Claude Sonnet 4.641.08
5Claude Opus 4.738.3
6Qwen 3.6 27B37.92
7GLM-5V Turbo33.5
8Qwen 3.5 Plus32.62
9Kimi K2.629.43
10Qwen 3.5 27B26.72
11Seed 2.0 Pro26.55
12GPT-5.4 Mini25
13Gemini 3.1 Flash Lite23.37
14Seed 2.0 Lite23.2
15Gemini 3 Flash22.99

Interactive version: theaggregate.ai/benchmark?slug=cattest-bug-discovery-p-score · How It Works · Data refreshed daily, snapshot 2026-09-19.