TuRTLe Spec-to-RTL (Verilator): leaderboard

TuRTLe leaderboard variant for spec-to-RTL generation evaluated with Verilator across VerilogEval S2R and RTLLM.

Metric: Average Score (%). Source: huggingface.co. Status: saturation imminent. 45 models tracked.

Top models

#ModelScore
1Kimi K2.578.8
2DeepSeek R1 052876.69
3GLM-5 FP875.67
4DeepSeek R174.74
5Gemma 4 31B (IT)74.15
6DeepSeek V3.1 Terminus73.59
7GPT-OSS-120B71.28
8GPT-OSS-20B62.49
9QwQ-32B57.97
10Llama 3.1 405B56.17
11Qwen 2.5 72B52.21
12Qwen 2.5 32B50.13
13starchat2-15B-v0.146.86
14Qwen 3 8B45.08
15Hermes-4-14B42.61

Interactive version: theaggregate.ai/benchmark?slug=turtle-spec-to-rtl-verilator · How It Works · Data refreshed daily, snapshot 2026-09-05.