LiveCodeBench Pro — leaderboard

Competitive coding problems at extreme difficulty. 'Hard' here means 99.9% of competitive coders can't solve them. Shows how LLMs stack up against elite human programmers.

Metric: Rating (CF-style). Source: livecodebenchpro.com. Status: years away from saturation. 58 models tracked.

Top models

#ModelScore
1Gemini 3 Deep Think3298
2Gemini 3.1 Pro (Preview)2887
3Gemini 3 Pro (Preview)2439
4Gemini 3 Flash (Preview)2316
5O4 Mini (2025-04-16) (High)2092
6Gemini 2.5 Pro1769
7O3 Mini (2025-01-31)1688
8Qwen 3 235B A22B (Thinking)1673
9Qwen 3 Next 80B A3B (Thinking)1603
10Claude Sonnet 4.5 (Thinking)1412
11Gemini 2.5 Flash (Preview 04-17)1334
12GPT-OSS-120B1299
13Gemini 2.5 Flash1288
14DeepSeek R1 05281284
15Qwen 3 Max1226

Interactive version: theaggregate.ai/benchmark?slug=livecodebench-pro · How the rankings work · Data refreshed daily, snapshot 2026-07-22.