PetriBench - MinimumTokenSteps (Hard): leaderboard

Metric: Exact-Match Accuracy (%). Source: arxiv.org. 36 models tracked.

Top models

#ModelScore
1Grok 4.6 (High)76.8
2Grok 4.6 (xHigh)74
3Grok 4.5 (High)71.8
4Grok 4.6 (Medium)71
5Grok 4.5 (Medium)66.8
6Claude Opus 5 (xHigh)54.8
7GPT-5.6 Sol (xHigh)53.2
8Gemini 3.1 Pro (Preview) (High)50
9Claude Opus 5 (High)46.5
10Gemini 3.8 Flash (Medium)36.8
11Gemini 3.1 Pro (Preview) (Medium)35.5
12GPT-5.6 Sol (High)33.8
13Claude Opus 5 (Medium)26.8
14GPT-5.6 Terra (xHigh)18.8
15DeepSeek V4 Flash (High)17.2

Interactive version: theaggregate.ai/benchmark?slug=petribench-minimumtokensteps-hard · How It Works · Data refreshed daily, snapshot 2026-09-20.