Harbor Adapters - BigCodeBench-Hard (Terminus-2): leaderboard

Metric: Pass rate (%; 145 tasks, mean of 3 trials). Source: arxiv.org. Saturation forecast: Around 2029. 8 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.644.6
2Claude Opus 4.644.4
3Gemini 3.1 Pro (Preview)40.5
4GPT-5.4 (Medium)39.5
5Claude Haiku 4.539.3
6Gemini 3 Flash (Preview)38.6
7GPT-5 Mini35.2
8GPT-5 Nano24.4

Interactive version: theaggregate.ai/benchmark?slug=harbor-adapters-bigcodebench-hard-terminus-2 · How It Works · Data refreshed daily, snapshot 2026-09-25.