LLM-as-a-Reviewer — leaderboard

Metric: Low (NeurIPS 2022) (self-reported). Source: benchmarklist.com. 12 models tracked.

Top models

#ModelScore
1Claude Haiku 4.599.7
2GPT-5.4 Mini99.7
3GPT-5.497.3
4GPT-5 Mini79.3
5GPT-4.1 Mini60.7
6Gemini 3.1 Flash Lite48.3
7Qwen 3 235B A22B48.3
8Gemini 2.5 Flash46.7
9Gemini 3 Flash (Preview)44.3
10Qwen 3.5 9B29.3
11GPT-4o Mini28
12Llama 3.3 70B Instruct6.7

Interactive version: theaggregate.ai/benchmark?slug=llm-as-a-reviewer · How the rankings work · Data refreshed daily, snapshot 2026-07-22.