Korean LLM Eval - MuSR (Ko): leaderboard

Metric: Accuracy (%, 0-shot). Source: github.com. 8 models tracked.

Top models

#ModelScore
1Claude Opus 5 (Medium)86.53
2GPT-5.6 Sol (Medium)85.31
3GPT-5.6 Terra (Medium)83.15
4DeepSeek V4 Flash (0731) (Max)82.4
5Claude Sonnet 5 (Medium)81.6
6DeepSeek V4 Flash (0731) (High)81.2
7GPT-5.6 Luna (Medium)71.47
8DeepSeek V4 Flash (0731) (Non-reasoning)57.33

Interactive version: theaggregate.ai/benchmark?slug=korean-llm-eval-musr-ko · How It Works · Data refreshed daily, snapshot 2026-09-22.