Bagel-Hermes-2x34B: benchmark results

Provider: Jon Durbin. Access: Open.

Unified ELO 1552 ± 20, rank #884 of 2928 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - MMLU77.24Accuracy (%) (5-shot)98.4
Open LLM Leaderboard v1 - WinoGrande84.77Accuracy (%) (5-shot)95
Open LLM Leaderboard v1 - GSM8K68.69Accuracy (%) (5-shot)86.8
Open LLM Leaderboard - MMLU-Pro45.89Score84.8
Open LLM Leaderboard v1 - ARC Challenge69.8Normalized accuracy (%) (25-shot)84.4
Open LLM Leaderboard - MuSR45.17Score84.2
Open LLM Leaderboard v1 - TruthfulQA MC264.82MC2 (%) (0-shot)82.7
Open LLM Leaderboard - GPQA32.8Score79.6
Open LLM Leaderboard v1 - HellaSwag85.26Normalized accuracy (%) (10-shot)73.1
Open LLM Leaderboard - IFEval54.32Score65.3
Open LLM Leaderboard - BBH49.17Score45.1
Open LLM Leaderboard - MATH Level 56.04Score33.1

Interactive version: theaggregate.ai/model?slug=bagel-hermes-2x34b · How It Works · Data refreshed daily, snapshot 2026-09-23.