Harbor Adapters - IneqMath (Terminus-2): leaderboard

Metric: Accuracy (%; 100 questions, mean of 3 trials). Source: arxiv.org. Saturation forecast: Estimated already saturated. 8 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.697
2Gemini 3.1 Pro (Preview)94.7
3GPT-5 Mini92.3
4Gemini 3 Flash (Preview)86.7
5Claude Opus 4.686
6GPT-5.4 (Medium)85.3
7GPT-5 Nano78
8Claude Haiku 4.573.3

Interactive version: theaggregate.ai/benchmark?slug=harbor-adapters-ineqmath-terminus-2 · How It Works · Data refreshed daily, snapshot 2026-09-25.