Ru Arena Hard: leaderboard

Russian-language Arena Hard Auto: pairwise comparison of LLM responses to Russian prompts using GPT-4 as judge, reporting win rates.

Metric: Win Rate (%). Source: huggingface.co. Status: saturated. 137 models tracked.

Top models

#ModelScore
1DeepSeek V3 Chat96.3
2GPT-4o ChatGPT94.75
3O1 Mini93.45
4Claude 3 Opus (20240229)91.3
5GPT-4 Preview (1106)90.89
6O1 Preview90.8
7Gemini 1.5 Pro (002)89.08
8Qwen 2.5 72B Instruct88.25
9Claude 3.5 Sonnet (20240620)88.17
10Gemma 2 27B (IT)86.87
11Phi-486.59
12Claude 3 Sonnet (20240229)84.27
13GPT-4o Mini83.9
14Llama 3.1 70B Instruct83.26
15Claude 3 Haiku (20240307)80.74

Interactive version: theaggregate.ai/benchmark?slug=ru-arena-hard · How It Works · Data refreshed daily, snapshot 2026-09-05.