PetriBench - L0-Liveness (Hard): leaderboard

Metric: Exact-Match Accuracy (%). Source: arxiv.org. 36 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (xHigh)91
2Claude Opus 5 (xHigh)90.5
3Claude Opus 5 (High)86.5
4Claude Opus 5 (Medium)81
5GPT-5.6 Sol (High)77
6Gemini 3.8 Flash (High)67.5
7Gemini 3.8 Flash (Medium)66.5
8Gemini 3.1 Pro (Preview) (High)64
9GPT-5.6 Terra (xHigh)63
10Grok 4.6 (xHigh)58.5
11Grok 4.6 (High)55.5
12GPT-5.6 Sol (Medium)55
13Grok 4.6 (Medium)53.5
14Grok 4.3 (Medium)53
15Claude Sonnet 5 (High)52.5

Interactive version: theaggregate.ai/benchmark?slug=petribench-l0-liveness-hard · How It Works · Data refreshed daily, snapshot 2026-09-20.