Cited but Not Verified — leaderboard

Metric: Relevant Content (self-reported). Source: benchmarklist.com. 14 models tracked.

Top models

#ModelScore
1Claude Opus 4.595.7
2GPT-5.493.7
3GPT-5.292.3
4Claude Haiku 4.591.1
5Claude Sonnet 4.689.8
6Claude Sonnet 4.588.3
7GPT-5 Mini87.4
8Claude Opus 4.683.9
9Gemini 3 Flash (Preview)82.9
10Gemini 3.1 Pro (Preview)80.7
11Pixtral Large64.9
12Llama 4 Maverick60.6

Interactive version: theaggregate.ai/benchmark?slug=cited-but-not-verified · How the rankings work · Data refreshed daily, snapshot 2026-07-22.