calme-3.3-baguette-3B — benchmark results
MaziyarPanahi's French-English fine-tune of Qwen2.5-3B, a later Calme-3 'baguette' iteration trained on LegalKit and French instruct data. Provider: Other. Released 2024-11-07. Access: Open.
Unified ELO 1450 ± 41, rank #1003 of 1776 rated models, from 10 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MATH Level 5 | 38.07 | Score | 88.4 |
| Open LLM Leaderboard - IFEval | 63.6 | Score | 75.8 |
| French LLM Leaderboard - Average | 34.41 | Average Score (%) | 59.3 |
| French LLM Leaderboard - IFEval FR | 46.12 | Score (%) | 59.3 |
| French LLM Leaderboard - BAC FR | 29.1 | Score (%) | 51.9 |
| Open LLM Leaderboard - MMLU-Pro | 26.02 | Score | 47.2 |
| French LLM Leaderboard - GPQA FR | 28.02 | Score (%) | 42.6 |
| Open LLM Leaderboard - BBH | 25.6 | Score | 39.3 |
| Open LLM Leaderboard - GPQA | 4.03 | Score | 35.2 |
| Open LLM Leaderboard - MuSR | 7.14 | Score | 33.5 |
Interactive version: theaggregate.ai/model?slug=calme-3-3-baguette-3b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.