Horangi 4 - Ko-MT-Bench: leaderboard

Metric: Judge rating (1-10, x10). Source: horangi.ai. 105 models tracked.

Top models

#ModelScore
1Claude Opus 4.6 (High)90.13
2GPT-5.189.63
3Gemini 3.5 Flash89.63
4Claude Opus 4.5 (20251101) (High)89.63
5Gemini 3 Flash (Preview)89.62
6Claude Sonnet 4.6 (High)89.5
7Claude Sonnet 4.5 (High)89.38
8GPT-OSS-120B (High)89.25
9Gemini 3.1 Pro (Preview) (High)89.25
10Claude Sonnet 5 (High)89.25
11Qwen 3.7 Max89.13
12Gemini 3 Pro (Preview) (High)89.13
13Gemini 3.1 Flash Lite (Preview)89
14MiMo-V2-Pro89
15GPT-5.2 (xHigh)88.88

Interactive version: theaggregate.ai/benchmark?slug=horangi-4-ko-mt-bench · How It Works · Data refreshed daily, snapshot 2026-09-19.