calme-3.3-baguette-3B: benchmark results

MaziyarPanahi's French-English fine-tune of Qwen2.5-3B, a later Calme-3 'baguette' iteration trained on LegalKit and French instruct data. Provider: Other. Released 2024-11-07. Access: Open.

Unified ELO 1516 ± 1, rank #626 of 1392 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 538.07Score88.4
Open LLM Leaderboard - IFEval63.6Score75.8
French LLM Leaderboard - Average34.41Average Score (%)59.3
French LLM Leaderboard - IFEval FR46.12Score (%)59.3
French LLM Leaderboard - BAC FR29.1Score (%)51.9
Open LLM Leaderboard - MMLU-Pro26.02Score47.2
French LLM Leaderboard - GPQA FR28.02Score (%)42.6
Open LLM Leaderboard - BBH25.6Score39.3
Open LLM Leaderboard - GPQA4.03Score35.2
Open LLM Leaderboard - MuSR7.14Score33.5

Interactive version: theaggregate.ai/model?slug=calme-3-3-baguette-3b · How It Works · Data refreshed daily, snapshot 2026-09-05.