PetriBench - Boundedness (Hard): leaderboard

Metric: Exact-Match Accuracy (%). Source: arxiv.org. 36 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (xHigh)69
2GPT-5.6 Sol (High)65
3Claude Opus 5 (High)60
4Claude Sonnet 5 (Medium)58
5Gemini 3.8 Flash (High)55.5
6Claude Opus 5 (xHigh)54.5
7GLM-554
8Kimi K2.552.5
9Claude Sonnet 5 (High)52.5
10Claude Opus 5 (Medium)52.5
11Gemma 4 31B (High)52
12Gemini 3.8 Flash (Medium)51.5
13Grok 4.6 (High)51
14Claude Haiku 4.550.5
15Grok 4.6 (xHigh)50.5

Interactive version: theaggregate.ai/benchmark?slug=petribench-boundedness-hard · How It Works · Data refreshed daily, snapshot 2026-09-20.