open-calm-7B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1194 ± 22, rank #2909 of 2928 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
pfgen-bench - Completion Mode - Helpfulness0.09Helpfulness Score43.1
pfgen-bench - Completion Mode - Truthfulness0.64Truthfulness Score35.5
pfgen-bench - Completion Mode - Score0.4pfgen Score (mean of three)32.3
pfgen-bench - Completion Mode - Fluency0.47Fluency Score28.8
Open LLM Leaderboard v1 - TruthfulQA MC244.15MC2 (%) (0-shot)26.1
Open LLM Leaderboard v1 - GSM8K0.23Accuracy (%) (5-shot)10.8
Open LLM Leaderboard v1 - MMLU25.22Accuracy (%) (5-shot)7.1
Open LLM Leaderboard v1 - HellaSwag30.65Normalized accuracy (%) (10-shot)5.7
Open LLM Leaderboard v1 - WinoGrande48.54Accuracy (%) (5-shot)0.5
Open LLM Leaderboard v1 - ARC Challenge20.48Normalized accuracy (%) (25-shot)0.1

Interactive version: theaggregate.ai/model?slug=open-calm-7b · How It Works · Data refreshed daily, snapshot 2026-09-23.