FinRiskAtlas - Applied Review - Decision-View Generation: leaderboard
Metric: Rubric Score (%; DeepSeek-V4-Flash judge). Source: arxiv.org. 32 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | DeepSeek V3 (0324) | 71.31 |
| 2 | Gemini 2.5 Flash | 65.27 |
| 3 | Gemini 3 Flash (Preview) | 64.61 |
| 4 | Kimi K3 | 64.13 |
| 5 | GPT-5.4 | 62.91 |
| 6 | Kimi K2.5 | 62.74 |
| 7 | GPT-5.6 Sol | 62.25 |
| 8 | Seed 2.0 Lite | 58.73 |
| 9 | GLM-5.2 | 58.59 |
| 10 | Qwen 3.7 Max | 57.84 |
| 11 | GLM-5 | 57.16 |
| 12 | Ling-2.6-1T | 55.69 |
| 13 | GPT-5.6 Terra | 54.72 |
| 14 | DeepSeek V4 Pro | 54.48 |
| 15 | Qwen3-Next-80B | 53.1 |
Interactive version: theaggregate.ai/benchmark?slug=finriskatlas-applied-review-decision-view-generation · How It Works · Data refreshed daily, snapshot 2026-09-19.