BagelMIsteryTour-v2-8x7B: benchmark results

Provider: Jon Durbin. Access: Open.

Unified ELO 1521 ± 19, rank #1034 of 2928 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - TruthfulQA MC274.54MC2 (%) (0-shot)95
Open LLM Leaderboard v1 - MMLU71.16Accuracy (%) (5-shot)94.8
Open LLM Leaderboard v1 - ARC Challenge72.7Normalized accuracy (%) (25-shot)93.1
Open LLM Leaderboard v1 - HellaSwag87.36Normalized accuracy (%) (10-shot)85.8
Open LLM Leaderboard v1 - WinoGrande82.64Accuracy (%) (5-shot)84.9
Open LLM Leaderboard - IFEval62.62Score74.6
Open LLM Leaderboard v1 - GSM8K61.33Accuracy (%) (5-shot)73.9
Open LLM Leaderboard - GPQA30.79Score65.2
Open LLM Leaderboard - MuSR42.03Score61
Open LLM Leaderboard - BBH51.59Score56.9
Open LLM Leaderboard - MMLU-Pro34.81Score50.9
Open LLM Leaderboard - MATH Level 59.37Score45.3

Interactive version: theaggregate.ai/model?slug=bagelmisterytour-v2-8x7b · How It Works · Data refreshed daily, snapshot 2026-09-23.