Twinkle Eval - TW-Legal Benchmark v1: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 29 models tracked.

Top models

#ModelScore
1Llama 4 Maverick Instruct FP861.4
2Llama 3.3 70B Instruct50.38
3NVIDIA-Nemotron-3-Super-120B-A12B-FP849.36
4GPT-OSS-120B (Medium)49.12
5Mistral-Large-3-675B-Instruct-251248.87
6Llama 4 Scout Instruct47.21
7GPT-OSS-120B (Low)46.09
8GPT-OSS-120B (High)45.93
9Gemma 3 27B (IT)43.75
10NVIDIA-Nemotron-3-Nano-30B-A3B-BF1641.91
11Ministral-3-14B-Instruct-251238.29
12Gemma 3 12B (IT)35.2
13Llama 3.1 8B Instruct34.67
14GPT-OSS-20B (High)32.7
15GPT-OSS-20B (Low)32.54

Interactive version: theaggregate.ai/benchmark?slug=twinkle-eval-tw-legal-benchmark-v1 · How It Works · Data refreshed daily, snapshot 2026-09-19.