TuRTLe Code Completion (Verilator): leaderboard

TuRTLe leaderboard variant for RTL code completion evaluated with Verilator across VerilogEval MC and VeriGen.

Metric: Average Score (%). Source: huggingface.co. Status: saturation imminent. 45 models tracked.

Top models

#ModelScore
1Kimi K2.596.31
2DeepSeek R195.9
3DeepSeek V3.1 Terminus95.25
4DeepSeek R1 052894.97
5GLM-5 FP892.73
6GPT-OSS-120B91.28
7Gemma 4 31B (IT)90.94
8Qwen 2.5 32B89.99
9Llama 3.1 405B89.35
10starchat2-15B-v0.187.81
11GPT-OSS-20B86.53
12Qwen 2.5 72B84.24
13QwQ-32B80.47
14Hermes-4-14B74.06
15Qwen 3 8B72.79

Interactive version: theaggregate.ai/benchmark?slug=turtle-code-completion-verilator · How It Works · Data refreshed daily, snapshot 2026-09-05.