autotrain-llama3-70B-orpo-v2: benchmark results

Provider: Other. Access: Open.

Unified ELO 1573 ± 20, rank #768 of 2928 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K84.23Accuracy (%) (5-shot)99.8
Open LLM Leaderboard v1 - MMLU80.07Accuracy (%) (5-shot)99.6
Open LLM Leaderboard v1 - WinoGrande84.93Accuracy (%) (5-shot)96.1
Open LLM Leaderboard v1 - ARC Challenge70.9Normalized accuracy (%) (25-shot)87.3
Open LLM Leaderboard - MMLU-Pro48.18Score86.7
Open LLM Leaderboard - BBH58.99Score80.3
Open LLM Leaderboard v1 - TruthfulQA MC262.82MC2 (%) (0-shot)79.8
Open LLM Leaderboard v1 - HellaSwag86.09Normalized accuracy (%) (10-shot)78.6
Open LLM Leaderboard - MATH Level 521.07Score72.7
Open LLM Leaderboard - IFEval54.06Score64.8
Open LLM Leaderboard - MuSR41.13Score51.4
Open LLM Leaderboard - GPQA29.36Score48.7

Interactive version: theaggregate.ai/model?slug=autotrain-llama3-70b-orpo-v2 · How It Works · Data refreshed daily, snapshot 2026-09-23.