LongJudgeBench (Reference): leaderboard
Metric: Judge accuracy (%) averaged over five datasets (DeepResearch Bench, RealDeepResearch, SurGE structure and content, VerifyBench, MA; WritingPreferenceBench has no references): agreement of the LLM judge's pairwise preferences (from pointwise scores, pairwise choices or listwise ranks) or correctness labels with the human reference judgments, averaged within query groups, temperature 0, judging with reference answers or expert reports; higher is better. Source: arxiv.org. Saturation forecast: Around July 2027. 8 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Qwen 3 Max | 67.44 |
| 2 | DeepSeek V4 Flash | 66.5 |
| 3 | GLM-5.1 | 64.96 |
| 4 | Kimi K2.6 | 61.22 |
| 5 | Qwen 3 32B (Non-reasoning) | 59.1 |
| 6 | Qwen 3 32B (Thinking) | 54.77 |
| 7 | GPT-5.2 | 47.93 |
| 8 | GPT-4o Mini | 47.35 |
Interactive version: theaggregate.ai/benchmark?slug=longjudgebench-reference · How It Works · Data refreshed daily, snapshot 2026-09-29.