calme-2.2-qwen2.5-72B — benchmark results
MaziyarPanahi's Calme 2.2 fine-tune of Qwen 2.5 72B. Provider: Other. Released 2024-09-19. Access: Open.
Unified ELO 1607 ± 11, rank #464 of 1776 rated models, from 130 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - IFEval | 84.77 | Score | 99.7 |
| Open LLM Leaderboard - BBH | 61.8 | Score | 99.6 |
| Open LLM Leaderboard - MATH Level 5 | 58.91 | Score | 99.6 |
| Open Arabic LLM - Arabic MMLU HT College Biology | 84.72 | Accuracy (%) | 98.8 |
| Open Arabic LLM - Arabic MMLU HT Medical Genetics | 79 | Accuracy (%) | 98.8 |
| Open LLM Leaderboard - MMLU-Pro | 51.31 | Score | 98.8 |
| Open Arabic LLM - Arabic MMLU HT Econometrics | 57.89 | Accuracy (%) | 98.5 |
| Open Arabic LLM - Arabic MMLU History (Middle School) | 74.38 | Accuracy (%) | 98.5 |
| Open Arabic LLM - Aratrust Unfairness | 96.36 | Accuracy (%) | 98.4 |
| Open Arabic LLM - Arabic MMLU HT College Computer Science | 68 | Accuracy (%) | 98.1 |
| Open Arabic LLM - Alghafa Multiple Choice Sentiment Task | 43.66 | Accuracy (%) | 97.8 |
| Open Arabic LLM - Arabic MMLU HT College Mathematics | 57 | Accuracy (%) | 97.8 |
Interactive version: theaggregate.ai/model?slug=calme-2-2-qwen2-5-72b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.