PetriBench - Medium: leaderboard

Metric: Exact-Match Accuracy (%). Source: arxiv.org. 36 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (xHigh)90.9
2Claude Opus 5 (xHigh)83.8
3Claude Opus 5 (High)81.9
4GPT-5.6 Sol (High)81.4
5Grok 4.6 (xHigh)80.9
6Grok 4.6 (High)76.5
7Grok 4.6 (Medium)75.7
8Gemini 3.8 Flash (High)74.5
9Claude Opus 5 (Medium)70
10Gemini 3.1 Pro (Preview) (High)69.9
11Grok 4.5 (High)67.2
12Grok 4.5 (Medium)65
13GPT-5.6 Terra (xHigh)64.4
14Gemini 3.8 Flash (Medium)58.7
15GPT-5.6 Sol (Medium)52.5

Interactive version: theaggregate.ai/benchmark?slug=petribench-medium · How It Works · Data refreshed daily, snapshot 2026-09-20.