MultiCalm-7B-slerp: benchmark results

Provider: Other. Access: Open.

Unified ELO 1500 ± 21, rank #1231 of 2928 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - TruthfulQA MC278.03MC2 (%) (0-shot)98
Open LLM Leaderboard v1 - WinoGrande85.24Accuracy (%) (5-shot)97.8
Open LLM Leaderboard v1 - HellaSwag89.12Normalized accuracy (%) (10-shot)97.3
Open LLM Leaderboard v1 - ARC Challenge73.04Normalized accuracy (%) (25-shot)95.2
Open LLM Leaderboard v1 - GSM8K70.58Accuracy (%) (5-shot)93.6
Open LLM Leaderboard - MuSR43.19Score72
Open LLM Leaderboard v1 - MMLU64.22Accuracy (%) (5-shot)66.9
Open LLM Leaderboard - BBH51.22Score55.1
Open LLM Leaderboard - IFEval39.27Score39
Open LLM Leaderboard - GPQA28.27Score37.6
Open LLM Leaderboard - MMLU-Pro30.33Score37.5
Open LLM Leaderboard - MATH Level 56.19Score33.9

Interactive version: theaggregate.ai/model?slug=multicalm-7b-slerp · How It Works · Data refreshed daily, snapshot 2026-09-23.