FinRiskAtlas - Applied Review - Legal-Judgment Generation: leaderboard

Metric: Rubric Score (%; DeepSeek-V4-Flash judge). Source: arxiv.org. 32 models tracked.

Top models

#ModelScore
1GPT-5.446.36
2Gemini 2.5 Flash45.29
3GPT-5.6 Sol42.09
4GPT-5.6 Luna41.7
5GPT-5.6 Terra40.98
6Gemini 3 Flash (Preview)40.48
7Ling-2.6-1T40.27
8GPT-5.4 Mini39.86
9Qwen 3 235B A22B39.26
10DeepSeek V3 (0324)36.26
11Qwen 3.7 Max36.22
12Claude Opus 4.735.53
13Kimi K335.05
14Qwen 3 14B35.02
15Qwen 3 32B34.54

Interactive version: theaggregate.ai/benchmark?slug=finriskatlas-applied-review-legal-judgment-generation · How It Works · Data refreshed daily, snapshot 2026-09-19.