Einstein-v4-7B: benchmark results

Provider: Other. Released 2024-02-22. Access: Open.

Unified ELO 1459 ± 19, rank #1650 of 2928 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR46.82Score90.6
Open LLM Leaderboard v1 - GSM8K57.62Accuracy (%) (5-shot)69.5
Open LLM Leaderboard v1 - ARC Challenge64.68Normalized accuracy (%) (25-shot)67.7
Open LLM Leaderboard v1 - TruthfulQA MC255.15MC2 (%) (0-shot)64.3
Open LLM Leaderboard v1 - HellaSwag83.75Normalized accuracy (%) (10-shot)61.2
Open LLM Leaderboard v1 - MMLU62.31Accuracy (%) (5-shot)55
Open LLM Leaderboard - IFEval47.08Score54.1
Open LLM Leaderboard v1 - WinoGrande76.24Accuracy (%) (5-shot)47
Open LLM Leaderboard - GPQA28.19Score36.8
YALL Nous Leaderboard48.04Average28.5
Open LLM Leaderboard - MMLU-Pro22.59Score23.4
Open LLM Leaderboard - BBH38.49Score22.6

Interactive version: theaggregate.ai/model?slug=einstein-v4-7b · How It Works · Data refreshed daily, snapshot 2026-09-23.