Evals for Every Language - TruthfulQA — leaderboard

Metric: Average Score (%). Source: huggingface.co. 31 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro0
2GPT-4o0
3Llama 3.3 70B Instruct0
4GPT-4.10
5GPT-50
6GPT-5 Nano0
7Llama 3.1 70B Instruct0
8Claude Sonnet 4.50
9GPT-5 Mini0
10Claude 3.7 Sonnet0
11Gemini 2.5 Flash0
12Phi-40
13Llama 4 Maverick0
14GPT-OSS-120B0
15Llama 3 70B Instruct0

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-truthfulqa · How the rankings work · Data refreshed daily, snapshot 2026-07-22.