Marco-o1: benchmark results

Provider: Other. Access: Open.

Unified ELO 1433 ± 19, rank #1640 of 2656 rated models, from 66 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 537.46Score87.9
Open Korean LLM - KorNAT-Helpful49.73Normalized accuracy (%)81.4
Open LLM Leaderboard - MMLU-Pro41.17Score74.8
Open Korean LLM - Ko-IFEval35.56Strict accuracy, prompt/instruction mean (%)73.3
Open LLM Leaderboard - BBH53.64Score67.1
Open Korean LLM - KorNAT-Harmless63.76Normalized accuracy (%)66.4
Open Japanese LLM - Wiki NER SET F17.08Score (%)62.7
Open Japanese LLM - Wiki Coreference SET F13.6Score (%)58.4
Open Japanese LLM - Xlsum JA Rouge126.78Score (%)58.3
Open Japanese LLM - Xlsum JA RougeLsum22.69Score (%)58.2
Open Korean LLM - Ko-GSM8K (flexible extract)24.56Exact match, flexible extract (%)57.7
Open Japanese LLM - Jnli Exact Match82.21Score (%)56.4

Interactive version: theaggregate.ai/model?slug=marco-o1 · How It Works · Data refreshed daily, snapshot 2026-09-19.