Evals for Every Language - TruthfulQA: leaderboard

Metric: Average Score (%). Source: huggingface.co. 31 models tracked.

Top models

#ModelScore
1GPT-4o0
2Gemini 2.5 Pro0
3Llama 3.3 70B Instruct0
4GPT-50
5GPT-4.10
6Claude Sonnet 4.50
7GPT-5 Nano0
8Llama 3.1 70B Instruct0
9Gemini 2.5 Flash0
10GPT-5 Mini0
11Claude 3.7 Sonnet0
12Phi-40
13GPT-OSS-120B0
14Llama 4 Maverick0
15Claude Sonnet 40

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-truthfulqa · How It Works · Data refreshed daily, snapshot 2026-09-05.