EuroEval Serbian Summarization - LR SUM SR — leaderboard

Metric: Score (%). Source: euroeval.com. 148 models tracked.

Top models

#ModelScore
1Bielik-11B-v2.3-Instruct31.95
2Llama 3.1 8B Instruct31.53
3Mistral Small 3.131.09
4Llama 3.3 70B Instruct31.08
5Qwen 3 14B (Non-reasoning)30.64
6Mistral Small 3.230.38
7Gemma 3 12B (IT)30.34
8Apertus-70B-Instruct-250930.32
9Qwen 3 30B A3B 2507 Instruct30.3
10Qwen 2.5 72B Instruct30.27
11GPT-4.130.11
12Qwen 3 1.7B (Non-reasoning)30.1
13Tiny Aya Global30.08
14Qwen 3 8B (Non-reasoning)30.07
15Gemini 3 Pro (Preview)30.06

Interactive version: theaggregate.ai/benchmark?slug=euroeval-serbian-summarization-lr-sum-sr · How the rankings work · Data refreshed daily, snapshot 2026-07-22.