ReLE - Coding: leaderboard

Metric: Accuracy (%). Source: raw.githubusercontent.com. 98 models tracked.

Top models

#ModelScore
1Qwen 3.6 Max Preview75.7
2GPT-5.6 Pro Sol75
3GPT-674.8
4Gemini 3.7 Flash74.8
5Gemini 3.1 Pro (Preview)74.2
6Gemini 3.5 Flash74.2
7Grok 4.674.2
8Qwen 3.7 Max73.3
9Gemini 3.8 Flash72.7
10Claude Opus 572.5
11DeepSeek V4.1 Flash72.5
12Claude Opus 4.8 (Thinking)72
13GPT-5.571.5
14Grok 4.571.3
15GPT-5.4 (High)70.5

Interactive version: theaggregate.ai/benchmark?slug=rele-coding · How It Works · Data refreshed daily, snapshot 2026-09-19.