Evals for Every Language - Language fi — leaderboard

Metric: Average Score (%). Source: huggingface.co. 71 models tracked.

Top models

#ModelScore
1Gemini 3.1 Pro (Preview)73.62
2Claude Opus 4.872.02
3Claude Sonnet 4.671.97
4Claude Sonnet 4.571.36
5Qwen 3.6 Plus71.32
6Claude Sonnet 470.07
7Claude Opus 4.770
8Llama 4 Maverick69.66
9Gemini 2.5 Pro69.46
10GPT-5.168.7
11GPT-567.9
12Gemini 3.1 Flash Lite67.86
13GPT-5.566.71
14Llama 3.1 70B Instruct66.49
15Mistral Medium 3.166.27

Interactive version: theaggregate.ai/benchmark?slug=evals-for-every-language-language-fi · How the rankings work · Data refreshed daily, snapshot 2026-07-22.