Calme-4x7B-MoE-v0.2 — benchmark results

Second iteration of MaziyarPanahi's Calme 4x7B MoE of his Calme-7B Mistral fine-tunes, with higher ARC and GSM8K scores than v0.1. Provider: Other. Released 2024-03-17. Access: Open.

Unified ELO 1403 ± 13, rank #1210 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC61.02Accuracy (%)85.8
Open Korean LLM Leaderboard348.12Average Score (%)70.8
Open LLM Leaderboard - MuSR12.54Score68.7
Open Chinese LLM - GSM8K50.19Accuracy (%)68.2
Open LLM Leaderboard - BBH31.4Score56.9
Open Chinese LLM - WinoGrande62.83Accuracy (%)49.1
Open Chinese LLM - ARC Challenge52.05Accuracy (%)48.1
Open Chinese LLM Leaderboard56.46Average Score (%)47.6
Open Chinese LLM - HellaSwag59.65Accuracy (%)47.3
Open LLM Leaderboard - IFEval42.94Score44.9
Open LLM Leaderboard - MATH Level 57.4Score38.9
Open LLM Leaderboard - MMLU-Pro22.86Score38.4

Interactive version: theaggregate.ai/model?slug=calme-4x7b-moe-v0-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.