Reflection-Llama-3.1-70B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1549 ± 1, rank #442 of 1392 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MMLU-Pro59.35Score99.9
Open LLM Leaderboard - GPQA15.1Score91.2
Open LLM Leaderboard - MuSR17.54Score88.9
Open LLM Leaderboard - BBH47.87Score87.7
Open LLM Leaderboard - MATH Level 527.57Score79.8
Enkrypt AI - Toxicity Risk1.8Risk Score73.3
Open LLM Leaderboard - IFEval59.91Score71.8
Enkrypt AI - Bias Risk80.88Risk Score61.6
Enkrypt AI - Jailbreak Risk7.43Risk Score59.4
Enkrypt AI - Risk Score36.98Risk Score35.6
Enkrypt AI - Safety Risk35.93Risk Score19.1
Enkrypt AI - Insecure Code Risk60.89Risk Score16.5

Interactive version: theaggregate.ai/model?slug=reflection-llama-3-1-70b · How It Works · Data refreshed daily, snapshot 2026-09-05.