ReLE - Law and Civil Service: leaderboard
Metric: Accuracy (%). Source: nonelinear.com. 178 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-5.5 | 89 |
| 2 | Doubao Seed 2.0 Mini | 88.7 |
| 3 | Qwen 3.7 Plus | 87 |
| 4 | GLM-5.2 | 86.7 |
| 5 | Qwen 3.8 Flash | 86.3 |
| 6 | Grok 4.5 | 86 |
| 7 | Qwen 3.8 Max | 86 |
| 8 | GPT-6 | 85.7 |
| 9 | Seed 2.0 Lite | 85.7 |
| 10 | Qwen 3.7 Max | 85.3 |
| 11 | Kimi K3 | 85.3 |
| 12 | DeepSeek V4.1 Flash | 85.3 |
| 13 | Qwen 3.5 122B A10B | 84.7 |
| 14 | Claude Opus 5 | 84.7 |
| 15 | Seed 2.0 Pro | 84.7 |
Interactive version: theaggregate.ai/benchmark?slug=rele-law-and-civil-service · How It Works · Data refreshed daily, snapshot 2026-09-19.