phi-2-orange-v2: benchmark results

Provider: Microsoft. Released 2024-03-04. Access: Open.

Unified ELO 1421 ± 19, rank #1969 of 2928 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K57.62Accuracy (%) (5-shot)69.5
Open LLM Leaderboard v1 - TruthfulQA MC254.84MC2 (%) (0-shot)63.7
Open LLM Leaderboard v1 - ARC Challenge61.86Normalized accuracy (%) (25-shot)54.8
Open LLM Leaderboard v1 - WinoGrande75.69Accuracy (%) (5-shot)43.6
Open LLM Leaderboard - BBH47.7Score40.8
Open LLM Leaderboard v1 - MMLU55.72Accuracy (%) (5-shot)37.2
Open LLM Leaderboard - IFEval36.7Score35.2
Open LLM Leaderboard v1 - HellaSwag76.32Normalized accuracy (%) (10-shot)28.5
Open LLM Leaderboard - MMLU-Pro25.32Score26
YALL Nous Leaderboard47.89Average25.9
Open LLM Leaderboard - MATH Level 54.08Score23.5
Open LLM Leaderboard - MuSR36.3Score19.5

Interactive version: theaggregate.ai/model?slug=phi-2-orange-v2 · How It Works · Data refreshed daily, snapshot 2026-09-23.