QuanBench+ - Cirq: leaderboard

Metric: Pass@1 (%): greedy decoding at temperature 0, one Cirq program per task, on the 42 framework-aligned QuanBench+ tasks (quantum algorithms, gate decomposition, state preparation), graded by executable functional tests with KL-divergence acceptance for probabilistic outputs; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 12 models tracked.

Top models

#ModelScore
1Gemini 3 Pro54.8
2GPT-5.152.4
3DeepSeek R145.2
4GLM-4.738.1
5Kimi K2 (Thinking)38.1
6Gemini 2.5 Flash35.7
7Claude 3.7 Sonnet35.7
8GPT-4.133.3
9Llama 4 Maverick28.6
10MiniMax-M2.123.8
11Qwen 2.5 7B Instruct4.8

Interactive version: theaggregate.ai/benchmark?slug=quanbench-plus-cirq · How It Works · Data refreshed daily, snapshot 2026-10-07.