Quantum API Drift - Qiskit 2.0: leaderboard

Metric: Pass@1 (%; unbiased estimator from 3 samples per task, macro-averaged over 50 Qiskit HumanEval-derived tasks) of code generated for Qiskit 2.0 (2.0.0), executed in that Qiskit environment; REST API access at temperature 0.8 with a 1,024-token output cap; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 16 models tracked.

Top models

#ModelScore
1Claude Opus 4.785.33
2GPT-5.3 Codex79.84
3Claude Sonnet 4.670
4GPT-5.470
5Grok 4.2063.33
6Kimi K250
7Nemotron 3 Super49.33
8Gemma 4 31B (IT)47.33
9GPT-OSS-120B42.67
10GPT-5.4 Nano40
11Devstral 233.11
12Qwen3 Coder31.33
13Qwen 3 32B29.33
14GLM-4.7 Flash24.67
15Llama 3.3 70B Instruct12.67

Interactive version: theaggregate.ai/benchmark?slug=quantum-api-drift-qiskit-2-0 · How It Works · Data refreshed daily, snapshot 2026-09-29.