Quantum API Drift - Qiskit 1.3: leaderboard

Metric: Pass@1 (%; unbiased estimator from 3 samples per task, macro-averaged over 50 Qiskit HumanEval-derived tasks) of code generated for Qiskit 1.3 (1.3.0), executed in that Qiskit environment; REST API access at temperature 0.8 with a 1,024-token output cap; higher is better. Source: arxiv.org. Saturation forecast: Around December 2027. 16 models tracked.

Top models

#ModelScore
1Grok 4.2051.33
2Claude Opus 4.743.33
3Kimi K242
4GPT-5.3 Codex35.77
5Nemotron 3 Super35.57
6GPT-OSS-120B34.67
7Devstral 228.77
8Qwen3 Coder28.67
9GPT-5.426.67
10GPT-5.4 Nano22.67
11Claude Sonnet 4.621.33
12GLM-4.7 Flash20.67
13Qwen 3 32B18.67
14Gemma 4 31B (IT)13.33
15Llama 3.3 70B Instruct4

Interactive version: theaggregate.ai/benchmark?slug=quantum-api-drift-qiskit-1-3 · How It Works · Data refreshed daily, snapshot 2026-09-29.