dolphin-2.9-llama3-8B: benchmark results

Provider: Cognitive Computations. Released 2024-04-20. Access: Open.

Unified ELO 1432 ± 40, rank #1648 of 2656 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR43.75Score76.4
Open Portuguese LLM - FaQuAD NLI72.43Macro F1 (%)65.7
Open Portuguese LLM - ASSIN2 RTE90.06Macro F1 (%)53.8
Open Portuguese LLM - ENEM60.04Accuracy (%)46.9
Open LLM Leaderboard - BBH49.5Score46.3
Open Portuguese LLM - BLUEX49.65Accuracy (%)45.6
Open LLM Leaderboard - GPQA28.69Score41.8
YALL Nous Leaderboard50.8Average38.6
Open LLM Leaderboard - IFEval38.5Score37.8
Open Portuguese LLM - OAB Exams37.86Accuracy (%)36.2
Open LLM Leaderboard - MATH Level 55.74Score31.8
Open LLM Leaderboard - MMLU-Pro27.71Score30.3

Interactive version: theaggregate.ai/model?slug=dolphin-2-9-llama3-8b · How It Works · Data refreshed daily, snapshot 2026-09-19.