HypoArena - Machine Learning: leaderboard

Metric: Rating on the 218 machine learning cases: Bradley-Terry-Davidson rating (base 1500, open-ended) from reference-independent pairwise judgments by seed-2.0-pro, both presentation orders, with the source-derived reference hypothesis set as an anonymous competitor; baseline single-pass generation; higher is better. Source: arxiv.org. Saturation forecast: Around September 2027. 15 models tracked.

Top models

#ModelScore
1GPT-5.4 (High)1650.6
2Claude Opus 4.6 (High)1618.9
3GLM-5.11595
4Claude Sonnet 4.6 (High)1579.3
5Kimi K2.61562.4
6DeepSeek V4 Flash (High)1522.1
7DeepSeek V4 Pro (High)1520.1
8MiniMax-M2.71505.2
9GLM-51450.2
10GPT-5.4 Mini (High)1437.4
11MiniMax-M2.51428.9
12Gemini 3 Flash (High)1422.2
13Gemini 3.1 Pro (Preview) (High)1407.5
14Kimi K2.5 (Thinking)1246.5

Interactive version: theaggregate.ai/benchmark?slug=hypoarena-machine-learning · How It Works · Data refreshed daily, snapshot 2026-09-29.