Snorkel Finance Reasoning: leaderboard

Metric: Accuracy (%, LLM judge against ground truth). Source: snorkel.ai. 26 models tracked.

Top models

#ModelScore
1Grok 453.1
2GPT-5.452
3Claude 3.7 Sonnet51.89
4GPT-551
5Claude Sonnet 449.37
6Claude Opus 448.1
7Gemini 3 Pro46.84
8GPT-5 Mini46.8
9O4 Mini45.57
10Claude Opus 4.145.56
11GPT-4.144.3
12O343.04
13Grok 341.8
14Grok 4 Fast (Reasoning)40.51
15Kimi K2 (Thinking)35

Interactive version: theaggregate.ai/benchmark?slug=snorkel-finance-reasoning · How It Works · Data refreshed daily, snapshot 2026-09-19.