PetriBench - Hard: leaderboard

Metric: Exact-Match Accuracy (%). Source: arxiv.org. 36 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (xHigh)77.8
2Claude Opus 5 (High)71.8
3Claude Opus 5 (xHigh)71.7
4GPT-5.6 Sol (High)59.8
5Claude Opus 5 (Medium)58.1
6Grok 4.6 (xHigh)56.5
7Grok 4.6 (High)55
8Grok 4.6 (Medium)52.6
9GPT-5.6 Terra (xHigh)50.7
10Grok 4.5 (High)50.1
11Grok 4.5 (Medium)48.9
12Gemini 3.1 Pro (Preview) (High)46.9
13Gemini 3.8 Flash (High)41.3
14Gemini 3.8 Flash (Medium)38.5
15Gemini 3.1 Pro (Preview) (Medium)34.8

Interactive version: theaggregate.ai/benchmark?slug=petribench-hard · How It Works · Data refreshed daily, snapshot 2026-09-20.