BLOOMZ-7b1: benchmark results

Provider: Other. Access: Open.

Unified ELO 1279 ± 19, rank #2758 of 2928 rated models, from 18 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - TruthfulQA MC245.2MC2 (%) (0-shot)30.1
Hallucinations Leaderboard38.75Average Task Score (score)28.9
Open LLM Leaderboard v1 - MMLU37.85Accuracy (%) (5-shot)19.6
Open LLM Leaderboard v1 - ARC Challenge42.49Normalized accuracy (%) (25-shot)18.6
Open LLM Leaderboard v1 - WinoGrande64.64Accuracy (%) (5-shot)17.6
Open LLM Leaderboard v1 - HellaSwag63.01Normalized accuracy (%) (10-shot)16.4
Greek MMLU - STEM34.27Accuracy (%)9.9
Open LLM Leaderboard v1 - GSM8K0.08Accuracy (%) (5-shot)9.5
Greek MMLU - Other32.3Accuracy (%)8.6
Greek MMLU32.4Accuracy (%)4.9
Greek MMLU - Humanities32.63Accuracy (%)2.5
Greek MMLU - Social Sciences30.03Accuracy (%)2.5

Interactive version: theaggregate.ai/model?slug=bloomz-7b1 · How It Works · Data refreshed daily, snapshot 2026-09-23.