Calme-4x7B-MoE-v0.1 — benchmark results

MaziyarPanahi's MoE combining four of his Calme-7B Mistral fine-tunes, aimed at generating notably clear, calm and coherent text. Provider: Other. Released 2024-03-17. Access: Open.

Unified ELO 1403 ± 12, rank #1209 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - TruthfulQA MC61.25Accuracy (%)88.1
Open Korean LLM Leaderboard345.98Average Score (%)70.5
Open Chinese LLM - GSM8K50.11Accuracy (%)67.8
Open LLM Leaderboard - BBH31.26Score56.3
Open Chinese LLM - WinoGrande63.3Accuracy (%)54.9
Open LLM Leaderboard - MuSR10.62Score53.5
Open Chinese LLM Leaderboard56.65Average Score (%)50.7
Open Chinese LLM - ARC Challenge52.39Accuracy (%)49.4
Open Chinese LLM - HellaSwag59.65Accuracy (%)47.3
Open LLM Leaderboard - IFEval43.15Score45.2
Open LLM Leaderboard - MATH Level 58.01Score40.9
Open LLM Leaderboard - MMLU-Pro22.85Score38.4

Interactive version: theaggregate.ai/model?slug=calme-4x7b-moe-v0-1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.