MiniChat-2-3B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1368 ± 21, rank #2365 of 2928 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K32.68Accuracy (%) (5-shot)49
Open LLM Leaderboard v1 - TruthfulQA MC249.64MC2 (%) (0-shot)45.6
Open LLM Leaderboard v1 - MMLU47.59Accuracy (%) (5-shot)26.6
Open LLM Leaderboard v1 - ARC Challenge44.88Normalized accuracy (%) (25-shot)20.5
Open LLM Leaderboard v1 - WinoGrande66.46Accuracy (%) (5-shot)20.3
Open LLM Leaderboard v1 - HellaSwag67.69Normalized accuracy (%) (10-shot)18.7
Open Portuguese LLM - FaQuAD NLI0Macro F1 (%)1
Open Portuguese LLM - ASSIN2 RTE0Macro F1 (%)0.9
Open Portuguese LLM - OAB Exams0Accuracy (%)0.9
Open Portuguese LLM - ENEM0Accuracy (%)0.8
Open Portuguese LLM - BLUEX0Accuracy (%)0.7

Interactive version: theaggregate.ai/model?slug=minichat-2-3b · How It Works · Data refreshed daily, snapshot 2026-09-23.