Harbor Adapters - Reasoning Gym (Terminus-2): leaderboard

Metric: Mean reward (%; 576 tasks, mean of 3 trials). Source: arxiv.org. Saturation forecast: Estimated already saturated. 8 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)90.6
2Claude Opus 4.687.5
3Claude Sonnet 4.686.9
4Gemini 3 Flash (Preview)86.8
5GPT-5.4 (Medium)84.2
6GPT-5 Mini84.1
7Claude Haiku 4.580.3
8GPT-5 Nano67.1

Interactive version: theaggregate.ai/benchmark?slug=harbor-adapters-reasoning-gym-terminus-2 · How It Works · Data refreshed daily, snapshot 2026-09-25.