Quantum API Drift - Qiskit 0.43: leaderboard

Metric: Pass@1 (%; unbiased estimator from 3 samples per task, macro-averaged over 50 Qiskit HumanEval-derived tasks) of code generated for Qiskit 0.43 (0.43.3), executed in that Qiskit environment; REST API access at temperature 0.8 with a 1,024-token output cap; higher is better. Source: arxiv.org. Saturation forecast: Around December 2026. 16 models tracked.

Top models

#ModelScore
1Claude Opus 4.772
2GPT-5.469.33
3GPT-5.3 Codex64.71
4Claude Sonnet 4.660.67
5Grok 4.2058.67
6Kimi K256.67
7GPT-OSS-120B51.68
8Nemotron 3 Super48.67
9Gemma 4 31B (IT)42.67
10Qwen3 Coder41.33
11Qwen 3 32B37.33
12Devstral 236.91
13GPT-5.4 Nano36
14Llama 3.3 70B Instruct35.33
15GLM-4.7 Flash23.33

Interactive version: theaggregate.ai/benchmark?slug=quantum-api-drift-qiskit-0-43 · How It Works · Data refreshed daily, snapshot 2026-09-29.