EuroEval Latvian NLU - Fullstack NER LV — leaderboard

Metric: Named entity recognition Score (%). Source: euroeval.com. 233 models tracked.

Top models

#ModelScore
1GPT-583.9
2Gemma 4 31B (IT)78.27
3GPT-5.4 Mini (High)77.5
4Claude Sonnet 4.5 (Thinking)76.75
5Qwen 3 4B 2507 (Thinking)73.2
6GPT-5.4 Mini (Medium)72.99
7Claude Sonnet 4.5 (Non-reasoning)71.39
8Gemma 4 26B A4B (IT)69.43
9Claude Sonnet 4.667.56
10Qwen 3 Next 80B A3B (Thinking)67.52
11Llama 3.1 70B66.65
12Qwen 3 30B A3B64.85
13Gemini 3 Pro (Preview)64.6
14Gemini 3.1 Flash Lite (Preview)64.3
15GLM-4.7 Flash63.5

Interactive version: theaggregate.ai/benchmark?slug=euroeval-latvian-nlu-fullstack-ner-lv · How the rankings work · Data refreshed daily, snapshot 2026-07-22.