chat_gpt2_dpo: benchmark results

Provider: Other. Access: Open.

Unified ELO 1198 ± 20, rank #2902 of 2928 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR38.18Score30.4
Open LLM Leaderboard v1 - TruthfulQA MC241.26MC2 (%) (0-shot)16.6
Open LLM Leaderboard - GPQA26.01Score13.2
Open LLM Leaderboard v1 - HellaSwag31.22Normalized accuracy (%) (10-shot)6.1
Open LLM Leaderboard - MMLU-Pro11.42Score5.9
Open LLM Leaderboard v1 - MMLU24.95Accuracy (%) (5-shot)5.8
Open LLM Leaderboard - MATH Level 50.53Score4.6
Open LLM Leaderboard v1 - GSM8K0Accuracy (%) (5-shot)4.6
Open LLM Leaderboard v1 - ARC Challenge23.98Normalized accuracy (%) (25-shot)3.2
Open LLM Leaderboard v1 - WinoGrande49.96Accuracy (%) (5-shot)2.7
Open LLM Leaderboard - BBH29.02Score1.8
Open LLM Leaderboard - IFEval9.86Score1.7

Interactive version: theaggregate.ai/model?slug=chat-gpt2-dpo · How It Works · Data refreshed daily, snapshot 2026-09-23.