AppellateGen: leaderboard

Metric: Mean LLM-Judge Score (0-5; verdict, fact, legal application, reasoning). Source: arxiv.org. Saturation forecast: Estimated already saturated. 11 models tracked.

Top models

#ModelScore
1QwQ-32B2.46
2Gemini 2.5 Flash (Non-reasoning)2.43
3Qwen 3 30B A3B 2507 (Thinking)2.3
4Qwen 3 30B A3B 2507 Instruct2.27
5Qwen 3 235B A22B 2507 Instruct2.26
6Gemini 2.5 Flash Lite (Non-reasoning)2.1
7DeepSeek R1 0528 Qwen3 8B2.09
8Qwen 3 8B (Non-reasoning)1.82
9GPT-OSS-120B1.79

Interactive version: theaggregate.ai/benchmark?slug=appellategen · How It Works · Data refreshed daily, snapshot 2026-09-25.