PetriBench - L4-Liveness (Hard): leaderboard

Metric: Exact-Match Accuracy (%). Source: arxiv.org. 36 models tracked.

Top models

#ModelScore
1Claude Opus 5 (High)93.5
2Claude Opus 5 (xHigh)92.5
3GPT-5.6 Sol (xHigh)91
4Grok 4.6 (Medium)84
5Gemini 3.1 Pro (Preview) (High)80
6Grok 4.6 (High)80
7Grok 4.6 (xHigh)79
8Claude Opus 5 (Medium)78.5
9Gemini 3.8 Flash (High)78
10GPT-5.6 Terra (xHigh)77
11GPT-5.6 Sol (High)74.5
12Grok 4.5 (High)74
13Grok 4.5 (Medium)73.5
14GPT-5.6 Luna (xHigh)61.5
15GPT-5.6 Sol (Medium)58

Interactive version: theaggregate.ai/benchmark?slug=petribench-l4-liveness-hard · How It Works · Data refreshed daily, snapshot 2026-09-20.