Median Expert: benchmark results

Median performance for the relevant expert population, used as a reference point alongside model results. Provider: Human.

Unified ELO 1973 ± 20, rank #2 of 1392 rated models, from 22 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
BALROG Crafter (VLM)90Progress (%)100
BigCodeBench97Pass@1 (%)100
ForecastBench70.7Overall Score (higher is better)100
LAB-Bench FigQA No Tools (Opus 4.6 System Card)77Accuracy (%)100
MMLU90Accuracy (%)100
MMSI-Bench97.2Accuracy (%)100
Video-MME-v294.94Avg Accuracy w/o sub (%)100
Visual Aesthetic Benchmark (VAB)77.7Overall Top-1 ap@1 (self-reported)100
VisualPuzzles89.3Overall Accuracy (%)100
AA MMMU-Pro85.4Accuracy (%)98.1
CodeElo1200Elo Rating91.2
GeoBench ACW4100Average Score85.1

Interactive version: theaggregate.ai/model?slug=median-expert · How It Works · Data refreshed daily, snapshot 2026-09-05.