LiveCodeBench Pro: leaderboard

Competitive coding problems at extreme difficulty. 'Hard' here means 99.9% of competitive coders can't solve them. Shows how LLMs stack up against elite human programmers.

Metric: Rating (CF-style). Source: livecodebenchpro.com. Status: saturation imminent. 58 models tracked.

Top models

#ModelScore
1Gemini 3 Deep Think3298
2Gemini 3.1 Pro (Preview)2887
3Gemini 3 Pro (Preview)2439
4GPT-5.2 (High)2393
5Gemini 3 Flash (Preview)2316
6GPT-5 (High)2176
7O4 Mini (2025-04-16) (High)2092
8Gemini 2.5 Pro1769
9Gemini 2.5 Pro (Preview 03-25)1694
10O3 Mini (2025-01-31)1688
11Qwen 3 235B A22B 2507 (Thinking)1673
12Qwen 3 Next 80B A3B (Thinking)1603
13Claude Sonnet 4.5 (Thinking)1412
14Gemini 2.5 Flash (Preview 04-17)1334
15GPT-OSS-120B1299

Interactive version: theaggregate.ai/benchmark?slug=livecodebench-pro · How It Works · Data refreshed daily, snapshot 2026-09-05.