Harbor Adapters - Humanity's Last Exam (Terminus-2): leaderboard

Metric: Accuracy (%; 249 questions, GPT-5 judge, mean of 3 trials). Source: arxiv.org. Saturation forecast: Around December 2026. 8 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)53.3
2Gemini 3 Flash (Preview)39.5
3Claude Opus 4.634.3
4Claude Sonnet 4.621.7
5GPT-5.4 (Medium)20.3
6GPT-5 Mini13.1
7Claude Haiku 4.56.4
8GPT-5 Nano5.8

Interactive version: theaggregate.ai/benchmark?slug=harbor-adapters-humanity-s-last-exam-terminus-2 · How It Works · Data refreshed daily, snapshot 2026-09-25.