Finance Agent v1.1: leaderboard

537 entry-level financial-analyst questions (data retrieval, market research, projections) answered with tool calls; Vals AI with Stanford researchers and a global systemically important bank.

Metric: Accuracy (%). Source: www.vals.ai. Status: saturation imminent. 51 models tracked.

Top models

#ModelScore
1Claude Opus 4.7 (High)64.37
2Claude Sonnet 4.6 (Max)63.33
3GPT-5.4 Pro (xHigh)61.5
4Muse Spark60.59
5DeepSeek V4 Pro (Max)60.39
6Claude Opus 4.660.1
7Claude Opus 4.6 (Adaptive Reasoning, Max Effort)60.05
8GPT-5.5 (xHigh)59.96
9Gemini 3.1 Pro (Preview) (High)59.72
10GPT-5.2 (xHigh)58.53
11GLM-5.157.66
12GPT-5.4 (xHigh)57.15
13Kimi K2.657.06
14GPT-5.1 (High)55.31
15Gemini 3 Pro (Preview) (High)55.15

Interactive version: theaggregate.ai/benchmark?slug=finance-agent-v1-1 · How It Works · Data refreshed daily, snapshot 2026-09-05.