openchat-3.6-8B-20240522 (2024-05-22) — benchmark results

Provider: Other. Released 2024-05-07. Access: Open.

Unified ELO 1351 ± 56, rank #1408 of 1776 rated models, from 22 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard385.58Average Score (%)75.2
Open PL LLM - RAG68.98Average RAG Score (%)75.2
Open LLM Leaderboard - GPQA9.06Score73.8
Open PL LLM - Multiple Choice51.85Average Multiple-Choice Score (%)71.3
Open PL LLM Leaderboard55.56Average Score (%)70.3
Open PL LLM - Generative59.09Average Generative Score (%)69.6
Open LLM Leaderboard - BBH33.23Score64.9
Open LLM Leaderboard - IFEval53.43Score63.8
Open Chinese LLM - C-Eval Semantic73.15Accuracy (%)61.7
Open Chinese LLM - GSM8K46.1Accuracy (%)52.1
Open LLM Leaderboard - MATH Level 59.97Score47.3
Open LLM Leaderboard - MMLU-Pro24.77Score44.4

Interactive version: theaggregate.ai/model?slug=openchat-3-6-8b-20240522-2024-05-22 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.