Human Expert — benchmark results

Expert-human baseline used as a reference point alongside model results. Provider: Human.

Unified ELO 2500 ± 48, rank #1 of 1776 rated models, from 72 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA AIME 2025100Accuracy (%)100
AA MATH-500100Accuracy (%)100
AA MMMU-Pro85.4Accuracy (%)100
AISI Cyber Cooling Tower 100M7Avg Steps (/7)100
AISI Cyber Cooling Tower 10M7Avg Steps (/7)100
AISI Cyber TLO 100M32Avg Steps (/32)100
AISI Cyber TLO 10M32Avg Steps (/32)100
ARC Challenge (AI2)100Accuracy (%)100
BALROG BabaIsAI (VLM)90Progress (%)100
BALROG BabyAI (VLM)98Progress (%)100
BALROG Crafter (VLM)90Progress (%)100
BALROG MiniHack (VLM)80Progress (%)100

Interactive version: theaggregate.ai/model?slug=human-expert · How the rankings work · Data refreshed daily, snapshot 2026-07-22.