maestrale-chat-v0.4-beta — benchmark results

mii-llm's Italian chat model built on Mistral-7B with continued Italian pretraining, SFT on 1.7M conversations, and DPO alignment. Provider: Other. Released 2024-06-06. Access: Open.

Unified ELO 1446 ± 8, rank #1017 of 1776 rated models, from 19 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Pinocchio Italian - Cultura63.6Accuracy (%)86.4
Pinocchio Italian - Diritto57.7Accuracy (%)86.4
Open Italian LLM - MMLU-Pro (IT)29.15Accuracy (%)82.1
Pinocchio Italian - Generale59.79Accuracy (%)79.5
Pinocchio Italian - Matematica E Scienze49.38Accuracy (%)70.5
Pinocchio Italian Leaderboard55.93Average Accuracy (%)70.5
Pinocchio Italian - Logica42.84Accuracy (%)63.6
EVALITA - admission-test55.62CPS55.3
EVALITA - evalita NER33.53CPS51.1
EVALITA - sentiment-analysis72.23CPS51.1
EVALITA - text-entailment73.89CPS45.7
EVALITA - summarization-fanpage25.69CPS42.6

Interactive version: theaggregate.ai/model?slug=maestrale-chat-v0-4-beta · How the rankings work · Data refreshed daily, snapshot 2026-07-22.