PM-LLM-Benchmark — leaderboard

Process mining benchmark evaluating LLMs across 8 categories: conformance checking, process modeling, querying, hypothesis generation, fairness, optimization, and vision tasks.

Metric: Score. Source: github.com. Status: saturation imminent. 164 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol (xHigh)40.2
2GPT-5.6 Sol (High)39.8
3Kimi K339.2
4GPT-5.6 Terra (High)38.4
5Kimi K2.637.8
6GPT-5.4 (xHigh)37.8
7GPT-5.5 (High)37.7
8GPT-5.3 Codex (xHigh)37.3
9GPT-5.6 Luna (High)37.2
10GPT-5.4 (High)37
11GPT-5.5 (xHigh)36.9
12GPT-5 Pro36.9
13GPT-5.2 (xHigh)36.7
14DeepSeek V4 Pro36.4
15GPT-5.6 Sol36.3

Interactive version: theaggregate.ai/benchmark?slug=pm-llm-benchmark · How the rankings work · Data refreshed daily, snapshot 2026-07-22.