calme-2.1-qwen2-7B — benchmark results

MaziyarPanahi's general-purpose fine-tune of Qwen2 7B, trained on OpenHermes-2.5, Orca math word problems, and HelpSteer2 to lift benchmark scores. Provider: Other. Released 2024-06-27. Access: Open.

Unified ELO 1436 ± 35, rank #1069 of 1776 rated models, from 7 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM Leaderboard451.88Average Score (%)83
Open LLM Leaderboard - MATH Level 523.11Score76.5
Open LLM Leaderboard - MuSR13.8Score75.9
Open LLM Leaderboard - MMLU-Pro29.92Score59.6
Open LLM Leaderboard - BBH31.01Score55.3
Open LLM Leaderboard - GPQA5.26Score44
Open LLM Leaderboard - IFEval38.16Score37.5

Interactive version: theaggregate.ai/model?slug=calme-2-1-qwen2-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.