FinRiskAtlas - Applied Review - Legal-Outcome Prediction: leaderboard
Metric: Accuracy (%). Source: arxiv.org. 33 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Kimi K3 | 68.15 |
| 2 | GPT-5.6 Terra | 67.83 |
| 3 | GPT-5.4 | 67.51 |
| 4 | GPT-5.6 Sol | 67.09 |
| 5 | Qwen 3.7 Max | 66.03 |
| 6 | Kimi K2.5 | 65.93 |
| 7 | GPT-5.6 Luna | 65.93 |
| 8 | GLM-5.2 | 65.71 |
| 9 | Qwen3-Next-80B | 65.71 |
| 10 | Claude Opus 4.7 | 65.19 |
| 11 | Qwen 3 235B A22B | 65.08 |
| 12 | DeepSeek V4 Pro | 64.97 |
| 13 | Qwen 3 14B | 64.97 |
| 14 | GPT-5.4 Mini | 64.97 |
| 15 | GLM-5 | 64.76 |
Interactive version: theaggregate.ai/benchmark?slug=finriskatlas-applied-review-legal-outcome-prediction · How It Works · Data refreshed daily, snapshot 2026-09-19.