FinRiskAtlas - Applied Review - Legal-Judgment Generation: leaderboard
Metric: Rubric Score (%; DeepSeek-V4-Flash judge). Source: arxiv.org. 32 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-5.4 | 46.36 |
| 2 | Gemini 2.5 Flash | 45.29 |
| 3 | GPT-5.6 Sol | 42.09 |
| 4 | GPT-5.6 Luna | 41.7 |
| 5 | GPT-5.6 Terra | 40.98 |
| 6 | Gemini 3 Flash (Preview) | 40.48 |
| 7 | Ling-2.6-1T | 40.27 |
| 8 | GPT-5.4 Mini | 39.86 |
| 9 | Qwen 3 235B A22B | 39.26 |
| 10 | DeepSeek V3 (0324) | 36.26 |
| 11 | Qwen 3.7 Max | 36.22 |
| 12 | Claude Opus 4.7 | 35.53 |
| 13 | Kimi K3 | 35.05 |
| 14 | Qwen 3 14B | 35.02 |
| 15 | Qwen 3 32B | 34.54 |
Interactive version: theaggregate.ai/benchmark?slug=finriskatlas-applied-review-legal-judgment-generation · How It Works · Data refreshed daily, snapshot 2026-09-19.