suzume-llama-3-8B-multilingual-orpo-borda-top25 — benchmark results

Lightblue's ORPO-tuned Suzume Llama 3 8B, preference-trained on the top 25% most consistently ranked responses from its Mitsu dataset. Provider: Lightblue. Released 2024-04-26. Access: Open.

Unified ELO 1405 ± 19, rank #1200 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard530.94Average Score (%)90.3
Open LLM Leaderboard - IFEval66.37Score78.4
Open Chinese LLM - GSM8K48.9Accuracy (%)63.4
Open LLM Leaderboard - MMLU-Pro29.83Score59.2
Open Chinese LLM - WinoGrande63.54Accuracy (%)58.5
Open Chinese LLM - CMMLU54.27Accuracy (%)55.3
Open LLM Leaderboard - MATH Level 510.42Score48.7
Open Chinese LLM Leaderboard56.28Average Score (%)45.3
Open Chinese LLM - C-Eval Semantic67.88Accuracy (%)44.5
Open LLM Leaderboard - BBH27.67Score44.2
Open Chinese LLM - HellaSwag58.82Accuracy (%)40.7
Open Chinese LLM - ARC Challenge48.72Accuracy (%)36.1

Interactive version: theaggregate.ai/model?slug=suzume-llama-3-8b-multilingual-orpo-borda-top25 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.