OpenHuEval: leaderboard

OpenHuEval evaluates large language models on Hungarian-specific tasks, including real user queries, self-awareness, proverb reasoning, generative evaluation, and fill-in-the-blank tasks.

Metric: Macro Average (computed) (self-reported). Source: benchmarklist.com. Status: saturated. 10 models tracked.

Top models

#ModelScore
1GPT-4o63.77
2DeepSeek R162.31
3DeepSeek V357.1
4O1 Mini49.38
5GPT-4o Mini49.33

Interactive version: theaggregate.ai/benchmark?slug=openhueval · How It Works · Data refreshed daily, snapshot 2026-09-05.