Halluverse-M3 — leaderboard

Multitask multilingual hallucination detection benchmark spanning QA and dialogue summarization in English, Arabic, Hindi, and Turkish.

Metric: Macro Accuracy (self-reported). Source: benchmarklist.com. Status: saturation imminent. 14 models tracked.

Top models

#ModelScore
1GPT-4o80.3
2GPT-4.178.66
3Claude 3.5 Sonnet (20240620)76.98
4DeepSeek V2.573.76
5GPT-4o Mini73.39
6Llama 3.3 70B70.53
7Phi-470.38
8Qwen 2.5 72B Instruct69.81
9Qwen 2.5 32B66.84
10Gemma 2 27B62.1
11Qwen 2.5 7B59.4
12Mistral 7B56.06

Interactive version: theaggregate.ai/benchmark?slug=halluverse-m3 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.