PetriBench - ReachableMarkings (Hard): leaderboard

Metric: Exact-Match Accuracy (%). Source: arxiv.org. 36 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (xHigh)86.2
2Claude Opus 5 (High)82
3Claude Opus 5 (xHigh)72.2
4Claude Opus 5 (Medium)67
5GPT-5.6 Sol (High)57.8
6GPT-5.6 Terra (xHigh)50.5
7Gemini 3.8 Flash (High)29
8Grok 4.6 (xHigh)27
9Grok 4.6 (High)22.8
10GPT-5.6 Luna (xHigh)22.2
11Grok 4.6 (Medium)21.8
12Gemini 3.1 Pro (Preview) (High)13.5
13Grok 4.5 (High)13.2
14GPT-5.6 Sol (Medium)12.8
15Grok 4.5 (Medium)12

Interactive version: theaggregate.ai/benchmark?slug=petribench-reachablemarkings-hard · How It Works · Data refreshed daily, snapshot 2026-09-20.