Harbor Adapters - SWT-Bench (Terminus-2): leaderboard

Metric: Pass rate (%; 50 tasks, mean of 3 trials). Source: arxiv.org. Saturation forecast: Around December 2026. 8 models tracked.

Top models

#ModelScore
1Claude Opus 4.667.3
2Gemini 3 Flash (Preview)60
3Gemini 3.1 Pro (Preview)57.3
4GPT-5.4 (Medium)54
5Claude Sonnet 4.644.7
6Claude Haiku 4.516
7GPT-5 Mini14.7
8GPT-5 Nano7.3

Interactive version: theaggregate.ai/benchmark?slug=harbor-adapters-swt-bench-terminus-2 · How It Works · Data refreshed daily, snapshot 2026-09-25.