FinChain — leaderboard

Financial chain-of-thought benchmark reporting ChainEval and lexical/semantic similarity metrics for general and finance-specific models.

Metric: ChainEval (self-reported). Source: benchmarklist.com. Status: saturation imminent. 25 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro58.65
2Claude Sonnet 4.558.22
3Claude Sonnet 458.18
4Gemini 2.5 Flash58.01
5Claude 3.7 Sonnet57.89
6GPT-5 Mini57.38
7GPT-4.1 Mini57.24
8GPT-557.07
9GPT-4.156.92
10DeepSeek V3.156.76
11Grok 4 Fast56.73
12DeepSeek V3.256.71

Interactive version: theaggregate.ai/benchmark?slug=finchain · How the rankings work · Data refreshed daily, snapshot 2026-07-22.