calme-3.2-instruct-78B — benchmark results

MaziyarPanahi's experimental 78B self-merge of Qwen2.5 72B, fine-tuned on custom datasets for general use. Provider: Other. Released 2024-11-19. Access: Open.

Unified ELO 1566 ± 20, rank #575 of 1776 rated models, from 21 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MMLU-Pro70.03Score100
Open LLM Leaderboard - MuSR38.53Score100
Open LLM Leaderboard - BBH62.61Score99.8
Open LLM Leaderboard - GPQA20.36Score99.2
Open LLM Leaderboard - IFEval80.63Score98.1
EVALITA - text-entailment84.31CPS95.7
EVALITA - word-in-context73.44CPS95.7
French LLM Leaderboard - IFEval FR66.84Score (%)94.4
EVALITA - sentiment-analysis80.15CPS93.6
EVALITA - hate-speech-detection75.82CPS91.5
French LLM Leaderboard - Average49.89Average Score (%)90.7
Open LLM Leaderboard - MATH Level 540.33Score90.2

Interactive version: theaggregate.ai/model?slug=calme-3-2-instruct-78b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.