LongJudgeBench (Rubric): leaderboard

Metric: Judge accuracy (%) averaged over the six datasets (DeepResearch Bench, RealDeepResearch, SurGE structure and content, WritingPreferenceBench, VerifyBench, MA): agreement of the LLM judge's pairwise preferences (from pointwise scores, pairwise choices or listwise ranks) or correctness labels with the human reference judgments, averaged within query groups, temperature 0, judging with task-specific rubrics; higher is better. Source: arxiv.org. Saturation forecast: Around July 2027. 8 models tracked.

Top models

#ModelScore
1Qwen 3 Max61.6
2GLM-5.161.47
3Kimi K2.661.33
4DeepSeek V4 Flash58.08
5Qwen 3 32B (Non-reasoning)55.94
6GPT-5.253.18
7Qwen 3 32B (Thinking)51.07
8GPT-4o Mini43.03

Interactive version: theaggregate.ai/benchmark?slug=longjudgebench-rubric · How It Works · Data refreshed daily, snapshot 2026-09-29.