calme-3.2-instruct-78B — benchmark results
MaziyarPanahi's experimental 78B self-merge of Qwen2.5 72B, fine-tuned on custom datasets for general use. Provider: Other. Released 2024-11-19. Access: Open.
Unified ELO 1566 ± 20, rank #575 of 1776 rated models, from 21 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MMLU-Pro | 70.03 | Score | 100 |
| Open LLM Leaderboard - MuSR | 38.53 | Score | 100 |
| Open LLM Leaderboard - BBH | 62.61 | Score | 99.8 |
| Open LLM Leaderboard - GPQA | 20.36 | Score | 99.2 |
| Open LLM Leaderboard - IFEval | 80.63 | Score | 98.1 |
| EVALITA - text-entailment | 84.31 | CPS | 95.7 |
| EVALITA - word-in-context | 73.44 | CPS | 95.7 |
| French LLM Leaderboard - IFEval FR | 66.84 | Score (%) | 94.4 |
| EVALITA - sentiment-analysis | 80.15 | CPS | 93.6 |
| EVALITA - hate-speech-detection | 75.82 | CPS | 91.5 |
| French LLM Leaderboard - Average | 49.89 | Average Score (%) | 90.7 |
| Open LLM Leaderboard - MATH Level 5 | 40.33 | Score | 90.2 |
Interactive version: theaggregate.ai/model?slug=calme-3-2-instruct-78b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.