AJ-Bench (LLM-as-a-Judge) - Wide Search: leaderboard

Metric: F1 (%) on Wide search (WideSearch-derived item checks; 9 tasks, 27 trajectories), averaged over three runs, with the judge reading the trajectory only (no tools or environment access), of AJ-Bench, judging whether agent trajectories succeeded against binary human-verified labels (155 tasks, 516 trajectories), default model configurations; higher is better. Source: arxiv.org. Saturation forecast: Not forecast. 13 models tracked.

Top models

#ModelScore
1Gemini 3 Pro (Preview)72.7
2Grok 469.18
3GLM-4.666.61
4Gemini 2.5 Pro66.35
5GPT-566.33
6LongCat-Flash-Chat64.44
7Claude Opus 4.564.26
8DeepSeek V3.263.65
9Kimi K2 090563.52
10Qwen 3 235B A22B62.69
11Claude Sonnet 4.561.02
12GPT-5 Mini (Low)60.84
13GPT-5.158.02

Interactive version: theaggregate.ai/benchmark?slug=aj-bench-llm-as-a-judge-wide-search · How It Works · Data refreshed daily, snapshot 2026-10-07.