LLM-as-a-Reviewer: leaderboard

Metric: Low (NeurIPS 2022) (self-reported). Source: benchmarklist.com. 12 models tracked.

Top models

#ModelScore
1Claude Haiku 4.599.7
2GPT-5.4 Mini99.7
3GPT-5.497.3
4GPT-5 Mini79.3
5GPT-4.1 Mini60.7
6Gemini 3.1 Flash Lite48.3
7Qwen 3 235B A22B48.3
8Gemini 2.5 Flash46.7
9Gemini 3 Flash44.3
10Qwen 3.5 9B29.3
11GPT-4o Mini28
12Llama 3.3 70B6.7

Interactive version: theaggregate.ai/benchmark?slug=llm-as-a-reviewer · How It Works · Data refreshed daily, snapshot 2026-09-05.