openchat-3.6-8B-20240522 (2024-05-22) — benchmark results
Provider: Other. Released 2024-05-07. Access: Open.
Unified ELO 1351 ± 56, rank #1408 of 1776 rated models, from 22 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Korean LLM Leaderboard | 385.58 | Average Score (%) | 75.2 |
| Open PL LLM - RAG | 68.98 | Average RAG Score (%) | 75.2 |
| Open LLM Leaderboard - GPQA | 9.06 | Score | 73.8 |
| Open PL LLM - Multiple Choice | 51.85 | Average Multiple-Choice Score (%) | 71.3 |
| Open PL LLM Leaderboard | 55.56 | Average Score (%) | 70.3 |
| Open PL LLM - Generative | 59.09 | Average Generative Score (%) | 69.6 |
| Open LLM Leaderboard - BBH | 33.23 | Score | 64.9 |
| Open LLM Leaderboard - IFEval | 53.43 | Score | 63.8 |
| Open Chinese LLM - C-Eval Semantic | 73.15 | Accuracy (%) | 61.7 |
| Open Chinese LLM - GSM8K | 46.1 | Accuracy (%) | 52.1 |
| Open LLM Leaderboard - MATH Level 5 | 9.97 | Score | 47.3 |
| Open LLM Leaderboard - MMLU-Pro | 24.77 | Score | 44.4 |
Interactive version: theaggregate.ai/model?slug=openchat-3-6-8b-20240522-2024-05-22 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.