calme-3.1-instruct-3B — benchmark results

MaziyarPanahi's general-purpose fine-tune of Qwen2.5 3B, trained on EvolKit and French instruction data. Provider: Other. Released 2024-11-07. Access: Open.

Unified ELO 1404 ± 19, rank #1206 of 1776 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MATH Level 517.75Score66.9
French LLM Leaderboard - BAC FR30.08Score (%)59.3
Open LLM Leaderboard - MMLU-Pro28.41Score53.3
Open LLM Leaderboard - IFEval43.36Score45.8
Open LLM Leaderboard - BBH27.31Score43.4
Open LLM Leaderboard - GPQA4.81Score41
French LLM Leaderboard - IFEval FR38.78Score (%)40.7
French LLM Leaderboard - Average31.2Average Score (%)38.9
Open LLM Leaderboard - MuSR7.4Score34.6
French LLM Leaderboard - GPQA FR24.73Score (%)11.1

Interactive version: theaggregate.ai/model?slug=calme-3-1-instruct-3b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.