Reflection-Llama-3.1-8B: benchmark results
Provider: Other. Access: Open.
Unified ELO 1145 ± 67, rank #2648 of 2656 rated models, from 11 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Portuguese LLM - OAB Exams | 48.61 | Accuracy (%) | 70.2 |
| Open Portuguese LLM - BLUEX | 55.22 | Accuracy (%) | 62.6 |
| Open Portuguese LLM - ENEM | 65.01 | Accuracy (%) | 60.3 |
| Open Portuguese LLM - ASSIN2 RTE | 90.31 | Macro F1 (%) | 56.3 |
| Open CoT - LSAT Reading Comprehension | 4.09 | CoT Gain (%) | 19.1 |
| Open Portuguese LLM - FaQuAD NLI | 43.97 | Macro F1 (%) | 17.1 |
| Open CoT - LSAT Analytical Reasoning | 0.43 | CoT Gain (%) | 10.3 |
| Open CoT - LogiQA | -0.96 | CoT Gain (%) | 3.1 |
| Open CoT Leaderboard | -0.06 | Average CoT Gain (%) | 3.1 |
| Open CoT - LSAT Logical Reasoning | -0.98 | CoT Gain (%) | 1.1 |
| Open CoT - LogiQA 2 | -2.86 | CoT Gain (%) | 0 |
Interactive version: theaggregate.ai/model?slug=reflection-llama-3-1-8b · How It Works · Data refreshed daily, snapshot 2026-09-19.