Multi-LCB - Pass@5 T0.6 - Python: leaderboard

Metric: Pass@5 (%). Source: arxiv.org. 25 models tracked.

Top models

#ModelScore
1GPT-OSS-120B (Medium)84.7
2GPT-OSS-20B (Medium)79.2
3Qwen 3 235B A22B (Thinking)71.1
4GPT-OSS-120B (Low)70.5
5Qwen 3 32B (Thinking)70.1
6Qwen 3 14B (Reasoning)68.4
7Qwen 3 30B A3B (Thinking)64.4
8Qwen 3 8B (Thinking)61
9GPT-OSS-20B (Low)59.9

Interactive version: theaggregate.ai/benchmark?slug=multi-lcb-pass-5-t0-6-python · How It Works · Data refreshed daily, snapshot 2026-09-19.