calme-3.3-instruct-3B — benchmark results

MaziyarPanahi's general-purpose fine-tune of Qwen2.5-3B, trained on arcee-ai EvolKit-20k and his French instruct dataset. Provider: Other. Released 2024-11-07. Access: Open.

Unified ELO 1464 ± 38, rank #939 of 1776 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 537.39Score87.8
Open LLM Leaderboard - IFEval64.23Score76.6
French LLM Leaderboard - IFEval FR49.67Score (%)68.5
French LLM Leaderboard - Average35.59Average Score (%)64.8
French LLM Leaderboard - BAC FR30.37Score (%)61.1
Open LLM Leaderboard - MMLU-Pro25.62Score46.3
Open LLM Leaderboard - MuSR9.4Score45.6
Open LLM Leaderboard - BBH25.68Score39.5
Open LLM Leaderboard - GPQA4.36Score37.6
French LLM Leaderboard - GPQA FR26.74Score (%)28.7

Interactive version: theaggregate.ai/model?slug=calme-3-3-instruct-3b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.