mt0-large: benchmark results

Provider: Other. Access: Open.

Unified ELO 1298 ± 17, rank #2464 of 2656 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - Ko-GPQA-Diamond28.79Normalized accuracy (%)98.1
Open Korean LLM - Ko-EQ-Bench0EQ-Bench score24.5
Greek MMLU - Other37.28Accuracy (%)23.5
Greek MMLU - Social Sciences37.09Accuracy (%)23.5
Greek MMLU36.95Accuracy (%)22.2
Greek MMLU - Greek-Specific34.95Accuracy (%)22.2
Greek MMLU - STEM36.89Accuracy (%)21
Greek MMLU - Humanities36.47Accuracy (%)19.8
Open Korean LLM - Ko-IFEval20.41Strict accuracy, prompt/instruction mean (%)18.8
Open Korean LLM - Ko-Winogrande52.88Accuracy (%)11.1
Open Korean LLM - Ko-GSM8K (flexible extract)0.53Exact match, flexible extract (%)9
Open Korean LLM Leaderboard28.56Average Score (%)6.9

Interactive version: theaggregate.ai/model?slug=mt0-large · How It Works · Data refreshed daily, snapshot 2026-09-19.