Twinkle Eval - TMMLU+: leaderboard

Metric: Accuracy (%). Source: huggingface.co. 29 models tracked.

Top models

#ModelScore
1NVIDIA-Nemotron-3-Super-120B-A12B-FP878.79
2Llama 4 Maverick Instruct FP878.38
3GPT-OSS-120B (High)74.78
4GPT-OSS-120B (Medium)74.64
5GPT-OSS-120B (Low)74.61
6Mistral-Large-3-675B-Instruct-251273.31
7Llama 4 Scout Instruct67.87
8GPT-OSS-20B (Low)66.93
9GPT-OSS-20B (Medium)66.59
10GPT-OSS-20B (High)66.26
11Llama 3.3 70B Instruct64.68
12NVIDIA-Nemotron-3-Nano-30B-A3B-BF1659.48
13Gemma 3 27B (IT)57.35
14Ministral-3-14B-Instruct-251255.46
15Gemma 3 12B (IT)47.17

Interactive version: theaggregate.ai/benchmark?slug=twinkle-eval-tmmlu-plus · How It Works · Data refreshed daily, snapshot 2026-09-19.