Llama3-ChatQA-1.5-8B — benchmark results

Provider: Meta. Released 2024-04-28. Access: Open.

Unified ELO 1334 ± 28, rank #1464 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - WinoGrande63.85Accuracy (%)61.9
Open PL LLM - Generative52.33Average Generative Score (%)57
Open PL LLM Leaderboard44.93Average Score (%)52.4
Open Chinese LLM - CMMLU53.35Accuracy (%)49.3
Open PL LLM - Multiple Choice35.3Average Multiple-Choice Score (%)44.1
Open PL LLM - RAG51.41Average RAG Score (%)41.6
Open Chinese LLM - HellaSwag57.87Accuracy (%)35.3
CyberMetric51.41Accuracy (%)33.3
ChineseSafe Benchmark61.28Accuracy (%)31.5
Open Chinese LLM - C-Eval Semantic61.17Accuracy (%)23.1
Polish EQ-Bench40.55EQ-Bench Score21.8
Open Chinese LLM - ARC Challenge45.56Accuracy (%)16.9

Interactive version: theaggregate.ai/model?slug=llama3-chatqa-1-5-8b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.