Ru Arena Hard — leaderboard

Russian-language Arena Hard Auto: pairwise comparison of LLM responses to challenging Russian prompts using GPT-4 as judge, reporting win rates.

Metric: Win Rate (%). Source: huggingface.co. Status: saturated. 137 models tracked.

Top models

#ModelScore
1DeepSeek V3 Chat96.3
2GPT-4o ChatGPT94.75
3Yi Lightning93.46
4O1 Mini93.45
5Claude 3 Opus (20240229)91.3
6GPT-4 Preview (1106)90.89
7O1 Preview90.8
8Gemini 1.5 Pro (002)89.08
9Gemini 1.5 Pro (Preview 0801)88.89
10Qwen 2.5 72B Instruct88.25
11Claude 3.5 Sonnet (20240620)88.17
12Phi-486.59
13Claude 3 Sonnet (20240229)84.27
14GPT-4o Mini83.9
15Llama 3.1 70B Instruct83.26

Interactive version: theaggregate.ai/benchmark?slug=ru-arena-hard · How the rankings work · Data refreshed daily, snapshot 2026-07-22.