Reflection-Llama-3.1-70B: benchmark results
Provider: Other. Access: Open.
Unified ELO 1549 ± 1, rank #442 of 1392 rated models, from 12 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - MMLU-Pro | 59.35 | Score | 99.9 |
| Open LLM Leaderboard - GPQA | 15.1 | Score | 91.2 |
| Open LLM Leaderboard - MuSR | 17.54 | Score | 88.9 |
| Open LLM Leaderboard - BBH | 47.87 | Score | 87.7 |
| Open LLM Leaderboard - MATH Level 5 | 27.57 | Score | 79.8 |
| Enkrypt AI - Toxicity Risk | 1.8 | Risk Score | 73.3 |
| Open LLM Leaderboard - IFEval | 59.91 | Score | 71.8 |
| Enkrypt AI - Bias Risk | 80.88 | Risk Score | 61.6 |
| Enkrypt AI - Jailbreak Risk | 7.43 | Risk Score | 59.4 |
| Enkrypt AI - Risk Score | 36.98 | Risk Score | 35.6 |
| Enkrypt AI - Safety Risk | 35.93 | Risk Score | 19.1 |
| Enkrypt AI - Insecure Code Risk | 60.89 | Risk Score | 16.5 |
Interactive version: theaggregate.ai/model?slug=reflection-llama-3-1-70b · How It Works · Data refreshed daily, snapshot 2026-09-05.