SnorkelUnderwrite: leaderboard

Metric: Overall accuracy (%, LLM-as-a-judge). Source: snorkel.ai. 33 models tracked.

Top models

#ModelScore
1GPT-5.491
2Claude Opus 4.186.3
3GPT-583.33
4Grok 483.3
5Grok 4 Fast (Reasoning)81.33
6Grok 378
7O4 Mini78
8O377
9Claude Opus 477
10Claude 3.7 Sonnet74.6
11Claude Sonnet 472.3
12GPT-5 Mini71.67
13Kimi K2 (Thinking)71.3
14GPT-4.170.6
15Gemini 2.5 Flash61

Interactive version: theaggregate.ai/benchmark?slug=snorkelunderwrite · How It Works · Data refreshed daily, snapshot 2026-09-19.