SnorkelFinance: leaderboard

Metric: Score (%, LLM judge over full agent traces). Source: snorkel.ai. 28 models tracked.

Top models

#ModelScore
1GPT-581
2O381
3Gemini 3 Pro80.34
4Claude Opus 4.180.3
5GPT-5 Mini79.3
6Claude Opus 478.3
7Claude 3.7 Sonnet77.9
8Claude Sonnet 476.6
9O4 Mini76.6
10Grok 474.04
11Grok 4 Fast (Reasoning)73.45
12Kimi K2 (Thinking)71.7
13GPT-OSS-120B66.6
14Grok 365.86
15O3 Mini63.79

Interactive version: theaggregate.ai/benchmark?slug=snorkelfinance · How It Works · Data refreshed daily, snapshot 2026-09-19.