calme-3.3-baguette-3B — benchmark results

MaziyarPanahi's French-English fine-tune of Qwen2.5-3B, a later Calme-3 'baguette' iteration trained on LegalKit and French instruct data. Provider: Other. Released 2024-11-07. Access: Open.

Unified ELO 1450 ± 41, rank #1003 of 1776 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 538.07Score88.4
Open LLM Leaderboard - IFEval63.6Score75.8
French LLM Leaderboard - Average34.41Average Score (%)59.3
French LLM Leaderboard - IFEval FR46.12Score (%)59.3
French LLM Leaderboard - BAC FR29.1Score (%)51.9
Open LLM Leaderboard - MMLU-Pro26.02Score47.2
French LLM Leaderboard - GPQA FR28.02Score (%)42.6
Open LLM Leaderboard - BBH25.6Score39.3
Open LLM Leaderboard - GPQA4.03Score35.2
Open LLM Leaderboard - MuSR7.14Score33.5

Interactive version: theaggregate.ai/model?slug=calme-3-3-baguette-3b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.