ProactBench - Emergent: leaderboard

Metric: Pass rate (%) on the Emergent triggers (turns 1-3: inferring an unstated need from a single disclosed anchor) over the 198 curated dialogues of ProactBench (about 624 rubric-scored trigger points: 201 Emergent, 232 Critical, 191 Recovery), each trigger judged Pass, Partial or Fail by a GPT-5.4 judge against a rubric written before the model answers; dialogue histories are fixed from a curation run and the model regenerates only at the triggers, sampled once at temperature 0.7; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 16 models tracked.

Top models

#ModelScore
1Claude Opus 4.772.1
2Gemini 3.1 Pro (Preview)70.2
3GPT-5.568.7
4Kimi K2.667.4
5Gemini 2.5 Pro (Medium)66.2
6MiMo-V2.5-Pro65.7
7DeepSeek V4 Flash61.7
8Gemini 2.5 Flash60.7
9O4 Mini (2025-04-16)52.7
10GPT-4o (2024-11-20)33.8
11Llama 4 Maverick22.4
12Qwen 2.5 7B Instruct21.9
13Qwen 3 1.7B20.4

Interactive version: theaggregate.ai/benchmark?slug=proactbench-emergent · How It Works · Data refreshed daily, snapshot 2026-10-07.