LLMEval-Fair - Law: leaderboard

Metric: Discipline Score (0-10). Source: github.com. 59 models tracked.

Top models

#ModelScore
1Qwen 3 235B A22B9.5
2DeepSeek R19.37
3QwQ-32B9.33
4Gemini 2.5 Pro (Preview)9.3
5DeepSeek V39.23
6GLM-4.69.23
7Qwen 3 32B9.1
8Kimi K29
9Gemini 2.5 Flash (Thinking)9
10Claude Sonnet 4.5 (Thinking)8.97
11GPT-58.87
12O1 (2024-12-17)8.77
13Claude Sonnet 4.58.73
14Claude Sonnet 4 (Thinking)8.73
15Claude Sonnet 48.7

Interactive version: theaggregate.ai/benchmark?slug=llmeval-fair-law · How It Works · Data refreshed daily, snapshot 2026-09-19.