phoenix-inst-chat-7B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1306 ± 20, rank #2678 of 2928 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
LLMsPark - Prisoner's Dilemma1047.4Elo Rating76.9
LLMsPark - Nim Game965.1Elo Rating61.5
LLMsPark - Trust Game942Elo Rating38.5
Open LLM Leaderboard v1 - TruthfulQA MC247.08MC2 (%) (0-shot)36.4
LLMsPark - Dictator Game970.8Elo Rating23.1
Open LLM Leaderboard v1 - MMLU39.06Accuracy (%) (5-shot)20.6
Open LLM Leaderboard v1 - ARC Challenge44.71Normalized accuracy (%) (25-shot)20.3
Open LLM Leaderboard v1 - HellaSwag63.23Normalized accuracy (%) (10-shot)16.5
Open LLM Leaderboard v1 - GSM8K1.29Accuracy (%) (5-shot)16.4
Open LLM Leaderboard v1 - WinoGrande62.83Accuracy (%) (5-shot)15.8

Interactive version: theaggregate.ai/model?slug=phoenix-inst-chat-7b · How It Works · Data refreshed daily, snapshot 2026-09-23.