Finance Agent v2 — leaderboard

Evaluating agents on core financial analyst tasks using the FAB v2 harness.

Metric: Score (self-reported). Source: benchmarklist.com. Status: saturation imminent. 33 models tracked.

Top models

#ModelScore
1Gemini 3.5 Flash57.9
2Gemini 3.5 Flash (High)57.86
3Claude Fable 5 (Max)56.31
4Claude Opus 4.8 (Max)53.92
5Claude Opus 4.853.9
6GPT-5.551.8
7GPT-5.5 (xHigh)51.76
8Claude Opus 4.7 (High)51.51
9Claude Opus 4.751.5
10Claude Sonnet 4.6 (Max)51.03
11Qwen 3.7 Max (Max)48.35
12MiniMax-M348.27
13GPT-5.4 Mini (xHigh)45.36
14GLM-5.144.79
15DeepSeek V4 Pro (Max)44.08

Interactive version: theaggregate.ai/benchmark?slug=finance-agent-v2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.