mistral-orpo-capybara-3k: benchmark results

Provider: Mistral. Access: Open.

Unified ELO 1458 ± 20, rank #1656 of 2928 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - HellaSwag85.98Normalized accuracy (%) (10-shot)77.8
Open Portuguese LLM - FaQuAD NLI72.6Macro F1 (%)66.1
Open LLM Leaderboard v1 - ARC Challenge63.57Normalized accuracy (%) (25-shot)63.3
Open LLM Leaderboard v1 - MMLU62.91Accuracy (%) (5-shot)57.4
Open LLM Leaderboard v1 - WinoGrande77.51Accuracy (%) (5-shot)56.4
Open Portuguese LLM - BLUEX52.43Accuracy (%)52.8
Open LLM Leaderboard v1 - GSM8K36.85Accuracy (%) (5-shot)52.2
Open Portuguese LLM - OAB Exams40.55Accuracy (%)44.6
Open Portuguese LLM - ENEM58.15Accuracy (%)43.3
Open Portuguese LLM - ASSIN2 RTE86.64Macro F1 (%)38.3
Open LLM Leaderboard v1 - TruthfulQA MC243.83MC2 (%) (0-shot)24.9

Interactive version: theaggregate.ai/model?slug=mistral-orpo-capybara-3k · How It Works · Data refreshed daily, snapshot 2026-09-23.