OrpoLlama-3-8B: benchmark results

Provider: Other. Released 2024-04-18. Access: Open.

Unified ELO 1453 ± 19, rank #1696 of 2928 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - MMLU65.76Accuracy (%) (5-shot)85.3
Open LLM Leaderboard v1 - WinoGrande78.3Accuracy (%) (5-shot)62
Open LLM Leaderboard v1 - GSM8K45.94Accuracy (%) (5-shot)59.8
Open LLM Leaderboard v1 - TruthfulQA MC252.4MC2 (%) (0-shot)55.7
Open LLM Leaderboard v1 - HellaSwag82.41Normalized accuracy (%) (10-shot)51.1
Open LLM Leaderboard v1 - ARC Challenge59.13Normalized accuracy (%) (25-shot)42.2
Open LLM Leaderboard - IFEval36.53Score35
Open LLM Leaderboard - GPQA27.94Score34.3
Open LLM Leaderboard - BBH44.24Score32.3
Open LLM Leaderboard - MATH Level 55.59Score30.9
Open LLM Leaderboard - MMLU-Pro27.05Score28.8
YALL Nous Leaderboard47.37Average20.9

Interactive version: theaggregate.ai/model?slug=orpollama-3-8b · How It Works · Data refreshed daily, snapshot 2026-09-23.