Kotlin-bench — leaderboard

Kotlin-specific code generation benchmark from Firebender evaluating LLM proficiency in Kotlin programming tasks.

Metric: Pass Rate (%). Source: firebender.com. Status: saturation imminent. 17 models tracked.

Top models

#ModelScore
1GPT-5.3 Codex49
2Claude Opus 4.546
3GPT-5.243
4Gemini 3 Pro42
5Gemini 3 Flash41
6GPT-5.1 Codex41
7Claude Sonnet 4.537
8GPT-5.2 Codex37
9Gemini 3.1 Pro (Preview)36
10Kimi K2.531
11GLM-530
12Claude Sonnet 429
13GLM-4.722
14GLM-4.7 FP815
15GPT-4.112

Interactive version: theaggregate.ai/benchmark?slug=kotlin-bench · How the rankings work · Data refreshed daily, snapshot 2026-07-22.