Einstein-v6.1-Llama3-8B — benchmark results

Provider: Other. Released 2024-04-19. Access: Open.

Unified ELO 1397 ± 8, rank #1241 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - WinoGrande65.04Accuracy (%)70.8
Open LLM Leaderboard - MuSR11.23Score58.3
Open LLM Leaderboard - IFEval45.68Score51
Open LLM Leaderboard - BBH29.38Score49.5
Open Chinese LLM - TruthfulQA MC53.51Accuracy (%)48.5
Open Chinese LLM - CMMLU53.24Accuracy (%)48.4
Open Chinese LLM - GSM8K42.15Accuracy (%)43
Open Chinese LLM - C-Eval Semantic67.01Accuracy (%)41.7
Open LLM Leaderboard - MMLU-Pro23.68Score41.3
Open Chinese LLM - HellaSwag58.46Accuracy (%)39.8
Open Chinese LLM Leaderboard55.26Average Score (%)38.9
Open LLM Leaderboard - GPQA4.25Score36.8

Interactive version: theaggregate.ai/model?slug=einstein-v6-1-llama3-8b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.