CapybaraHermes-2.5-Mistral-7B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1475 ± 20, rank #1514 of 2928 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - HellaSwag85.45Normalized accuracy (%) (10-shot)74.5
Open Portuguese LLM - FaQuAD NLI74.9Macro F1 (%)71.8
Open LLM Leaderboard v1 - ARC Challenge65.78Normalized accuracy (%) (25-shot)71.1
Open LLM Leaderboard v1 - GSM8K59.29Accuracy (%) (5-shot)71.1
Open LLM Leaderboard v1 - TruthfulQA MC256.91MC2 (%) (0-shot)69
Open LLM Leaderboard v1 - WinoGrande78.3Accuracy (%) (5-shot)62
Open LLM Leaderboard v1 - MMLU63.13Accuracy (%) (5-shot)58.6
Open Portuguese LLM - OAB Exams44.33Accuracy (%)57.9
Open Portuguese LLM - ASSIN2 RTE90.1Macro F1 (%)54.1
Open Portuguese LLM - BLUEX52.43Accuracy (%)52.8
Open Portuguese LLM - ENEM62.42Accuracy (%)51.6

Interactive version: theaggregate.ai/model?slug=capybarahermes-2-5-mistral-7b · How It Works · Data refreshed daily, snapshot 2026-09-23.