Calme-4x7B-MoE-v0.2: benchmark results

Second iteration of MaziyarPanahi's Calme 4x7B MoE of his Calme-7B Mistral fine-tunes, with higher ARC and GSM8K scores than v0.1. Provider: Other. Released 2024-03-17. Access: Open.

Unified ELO 1474 ± 1, rank #820 of 1392 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC61.02Accuracy (%)85.8
Open Korean LLM Leaderboard43.12Average Score (%)85.6
Open LLM Leaderboard - MuSR12.54Score68.7
Open Chinese LLM - GSM8K50.19Accuracy (%)68.2
Open LLM Leaderboard - BBH31.4Score56.9
Open Chinese LLM - WinoGrande62.83Accuracy (%)49.1
Open Chinese LLM - ARC Challenge52.05Accuracy (%)48.1
Open Chinese LLM Leaderboard56.46Average Score (%)47.6
Open Chinese LLM - HellaSwag59.65Accuracy (%)47.3
Open LLM Leaderboard - IFEval42.94Score44.9
Open LLM Leaderboard - MATH Level 57.4Score38.9
Open LLM Leaderboard - MMLU-Pro22.86Score38.5

Interactive version: theaggregate.ai/model?slug=calme-4x7b-moe-v0-2 · How It Works · Data refreshed daily, snapshot 2026-09-05.