mt0-large: benchmark results
Provider: Other. Access: Open.
Unified ELO 1298 ± 17, rank #2464 of 2656 rated models, from 16 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Korean LLM - Ko-GPQA-Diamond | 28.79 | Normalized accuracy (%) | 98.1 |
| Open Korean LLM - Ko-EQ-Bench | 0 | EQ-Bench score | 24.5 |
| Greek MMLU - Other | 37.28 | Accuracy (%) | 23.5 |
| Greek MMLU - Social Sciences | 37.09 | Accuracy (%) | 23.5 |
| Greek MMLU | 36.95 | Accuracy (%) | 22.2 |
| Greek MMLU - Greek-Specific | 34.95 | Accuracy (%) | 22.2 |
| Greek MMLU - STEM | 36.89 | Accuracy (%) | 21 |
| Greek MMLU - Humanities | 36.47 | Accuracy (%) | 19.8 |
| Open Korean LLM - Ko-IFEval | 20.41 | Strict accuracy, prompt/instruction mean (%) | 18.8 |
| Open Korean LLM - Ko-Winogrande | 52.88 | Accuracy (%) | 11.1 |
| Open Korean LLM - Ko-GSM8K (flexible extract) | 0.53 | Exact match, flexible extract (%) | 9 |
| Open Korean LLM Leaderboard | 28.56 | Average Score (%) | 6.9 |
Interactive version: theaggregate.ai/model?slug=mt0-large · How It Works · Data refreshed daily, snapshot 2026-09-19.