LongJudgeBench (Reference + Rubric): leaderboard
Metric: Judge accuracy (%) averaged over five datasets (DeepResearch Bench, RealDeepResearch, SurGE structure and content, VerifyBench, MA; WritingPreferenceBench has no references): agreement of the LLM judge's pairwise preferences (from pointwise scores, pairwise choices or listwise ranks) or correctness labels with the human reference judgments, averaged within query groups, temperature 0, judging with both references and rubrics; higher is better. Source: arxiv.org. Saturation forecast: Around 2030. 8 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | DeepSeek V4 Flash | 64.31 |
| 2 | Qwen 3 Max | 62.54 |
| 3 | Qwen 3 32B (Non-reasoning) | 60.81 |
| 4 | GLM-5.1 | 60.32 |
| 5 | Kimi K2.6 | 59.37 |
| 6 | GPT-4o Mini | 55.53 |
| 7 | Qwen 3 32B (Thinking) | 54.48 |
| 8 | GPT-5.2 | 45.48 |
Interactive version: theaggregate.ai/benchmark?slug=longjudgebench-reference-plus-rubric · How It Works · Data refreshed daily, snapshot 2026-09-29.