FinRiskAtlas - Evidence-Grounded Processing - Information Extraction: leaderboard

Metric: Field-Level Score (%). Source: arxiv.org. 33 models tracked.

Top models

#ModelScore
1GPT-5.6 Luna85.97
2GPT-5.6 Sol85.07
3Seed 2.0 Lite84.48
4Kimi K2.584.28
5GPT-5.483.98
6GPT-5.4 Mini83.78
7GPT-5.6 Terra83.48
8Qwen 3.7 Max82.79
9GLM-5.281.69
10Nemotron 3 Ultra81.49
11GLM-581.39
12Qwen 3 235B A22B81.25
13DeepSeek V3 (0324)79.12
14Qwen 3 14B76.82
15Claude Opus 4.776.62

Interactive version: theaggregate.ai/benchmark?slug=finriskatlas-evidence-grounded-processing-information-extraction · How It Works · Data refreshed daily, snapshot 2026-09-19.