Harbor Adapters - SimpleQA (Terminus-2): leaderboard

Metric: Accuracy (%; 200 questions, LLM judge, mean of 3 trials). Source: arxiv.org. Saturation forecast: Estimated already saturated. 8 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)95
2Claude Opus 4.690.7
3Gemini 3 Flash (Preview)84
4Claude Sonnet 4.680.7
5GPT-5.4 (Medium)74.8
6GPT-5 Mini64.5
7Claude Haiku 4.557.3
8GPT-5 Nano15.8

Interactive version: theaggregate.ai/benchmark?slug=harbor-adapters-simpleqa-terminus-2 · How It Works · Data refreshed daily, snapshot 2026-09-25.