OpenHuEval — leaderboard

OpenHuEval evaluates large language models on Hungarian-specific tasks, including real user queries, self-awareness, proverb reasoning, generative evaluation, and fill-in-the-blank tasks.

Metric: Macro Average (computed) (self-reported). Source: benchmarklist.com. Status: saturation imminent. 10 models tracked.

Top models

#ModelScore
1GPT-4o63.77
2DeepSeek V357.1
3Llama 3.1 70B Instruct50.41
4O1 Mini49.38
5GPT-4o Mini49.33
6Llama 3.1 8B Instruct28.73

Interactive version: theaggregate.ai/benchmark?slug=openhueval · How the rankings work · Data refreshed daily, snapshot 2026-07-22.