RealVuln - F1: leaderboard

Metric: Strict F1 score of vulnerability findings against 796 hand-labeled entries in 26 intentionally vulnerable Python repositories, agentic scanning; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 10 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.660.9
2Gemini 3.1 Pro (Preview)60.1
3Claude Opus 4.657.8
4GLM-555.5
5Kimi K2.554.3
6MiniMax-M2.748.7
7Claude Haiku 4.547.9
8Qwen 3.5 397B A17B46
9Grok 4.20 (Reasoning)41
10Grok 331.9

Interactive version: theaggregate.ai/benchmark?slug=realvuln-f1 · How It Works · Data refreshed daily, snapshot 2026-10-07.