AJ-Bench (LLM-as-a-Judge) - Deep Search: leaderboard

Metric: F1 (%) on Deep search (Mind2Web 2-derived items; 52 tasks, 156 trajectories), averaged over three runs, with the judge reading the trajectory only (no tools or environment access), of AJ-Bench, judging whether agent trajectories succeeded against binary human-verified labels (155 tasks, 516 trajectories), default model configurations; higher is better. Source: arxiv.org. Saturation forecast: Not forecast. 13 models tracked.

Top models

#ModelScore
1LongCat-Flash-Chat81.8
2Claude Sonnet 4.581.34
3Qwen 3 235B A22B81.33
4Gemini 3 Pro (Preview)81.26
5Gemini 2.5 Pro81.22
6Claude Opus 4.581.11
7GPT-580.37
8Kimi K2 090580.17
9Grok 478.32
10GLM-4.677.88
11GPT-5.170.9
12GPT-5 Mini (Low)68.42
13DeepSeek V3.262.91

Interactive version: theaggregate.ai/benchmark?slug=aj-bench-llm-as-a-judge-deep-search · How It Works · Data refreshed daily, snapshot 2026-10-07.