TuRTLe - Verilator Functionality — leaderboard

Metric: Average Score (%). Source: huggingface.co. 44 models tracked.

Top models

#ModelScore
1Kimi K2.578.8
2DeepSeek R1 052876.69
3GLM-5 FP875.67
4DeepSeek R174.74
5Gemma 4 31B (IT)74.15
6DeepSeek V3.1 Terminus73.59
7GPT-OSS-120B71.28
8GPT-OSS-20B62.49
9QwQ-32B57.97
10Llama 3.1 405B56.17
11Qwen 2.5 72B52.21
12Qwen 2.5 32B50.13
13starchat2-15B-v0.146.86
14Qwen 3 8B45.08
15Hermes-4-14B42.61

Interactive version: theaggregate.ai/benchmark?slug=turtle-verilator-functionality · How the rankings work · Data refreshed daily, snapshot 2026-07-22.