Harbor Adapters - SWE-bench Multilingual (Terminus-2): leaderboard

Metric: Resolved rate (%; 50 tasks, mean of 3 trials). Source: arxiv.org. Saturation forecast: Around December 2026. 8 models tracked.

Top models

#ModelScore
1Claude Opus 4.680
2Gemini 3.1 Pro (Preview)76.7
3Gemini 3 Flash (Preview)74.7
4Claude Sonnet 4.673.3
5Claude Haiku 4.568.7
6GPT-5.4 (Medium)60.7
7GPT-5 Mini21.3
8GPT-5 Nano4.7

Interactive version: theaggregate.ai/benchmark?slug=harbor-adapters-swe-bench-multilingual-terminus-2 · How It Works · Data refreshed daily, snapshot 2026-09-25.