SnorkelSequences: leaderboard

Metric: Accuracy@1 (%, 250 compositional sequence questions). Source: snorkel.ai. 32 models tracked.

Top models

#ModelScore
1GPT-577.6
2GPT-5 Mini77.6
3GPT-5 Nano72
4GPT-5.471.6
5O3 Mini71.2
6Gemini 2.5 Flash70.8
7Claude Sonnet 470.4
8Grok 4 Fast (Reasoning)70.2
9O4 Mini68.8
10Gemini 2.5 Pro66
11Claude Opus 465.6
12O365.2
13Grok 463.2
14Llama 4 Maverick62
15Nova Premier51.8

Interactive version: theaggregate.ai/benchmark?slug=snorkelsequences · How It Works · Data refreshed daily, snapshot 2026-09-19.