Reflection-Llama-3.1-8B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1145 ± 67, rank #2648 of 2656 rated models, from 11 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Portuguese LLM - OAB Exams48.61Accuracy (%)70.2
Open Portuguese LLM - BLUEX55.22Accuracy (%)62.6
Open Portuguese LLM - ENEM65.01Accuracy (%)60.3
Open Portuguese LLM - ASSIN2 RTE90.31Macro F1 (%)56.3
Open CoT - LSAT Reading Comprehension4.09CoT Gain (%)19.1
Open Portuguese LLM - FaQuAD NLI43.97Macro F1 (%)17.1
Open CoT - LSAT Analytical Reasoning0.43CoT Gain (%)10.3
Open CoT - LogiQA-0.96CoT Gain (%)3.1
Open CoT Leaderboard-0.06Average CoT Gain (%)3.1
Open CoT - LSAT Logical Reasoning-0.98CoT Gain (%)1.1
Open CoT - LogiQA 2-2.86CoT Gain (%)0

Interactive version: theaggregate.ai/model?slug=reflection-llama-3-1-8b · How It Works · Data refreshed daily, snapshot 2026-09-19.