Finance Agent v2: leaderboard

Evaluating agents on core financial analyst tasks using the FAB v2 harness.

Metric: Accuracy (%). Source: www.vals.ai. Status: saturation imminent. 57 models tracked.

Top models

#ModelScore
1Gemini 3.8 Flash (High)61.44
2Muse Spark 1.2 (xHigh)60.6
3Gemini 3.7 Flash (High)59.04
4Claude Fable 5.1 (Max)58.88
5Claude Opus 5 (Max)58.63
6Gemini 3.5 Flash (High)57.86
7GLM-5.3 Flash (Max)57.85
8Muse Spark 1.1 (xHigh)57.21
9Claude Fable 5 (Max)56.31
10Gemini 3.6 Flash (High)56.3
11GLM-5.3 (Max)55.84
12GPT-5.6 Luna (Max)55.04
13GPT-5.6 Terra (Max)54.44
14Kimi K354.36
15Claude Opus 4.8 (Max)53.92

Interactive version: theaggregate.ai/benchmark?slug=finance-agent-v2 · How It Works · Data refreshed daily, snapshot 2026-09-05.