Llama 3 70B Chat: benchmark results

Provider: Meta. Released 2024-04-18. Access: Open.

Unified ELO 1566 ± 33, rank #766 of 2656 rated models, from 24 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SAD - Self-Recognition (Situating Prompt)73.69Score (%, higher is better)90
SAD - Introspection (Situating Prompt)35.81Score (%, higher is better)85
SAD - Predict Words40.56Self-prediction score (%, higher is better)81.8
SAD - Introspection34.81Score (%, higher is better)80
SAD - Self-Recognition65.69Score (%, higher is better)80
SAD - Stages (Situating Prompt)48.44Score (%, higher is better)80
SAD - Predict Words (Situating Prompt)38.56Self-prediction score (%, higher is better)77.3
SAD - Influence65.31Score (%, higher is better)75
SAD - Mini60.64Score (%, higher is better)75
SAD - Stages46.91Score (%, higher is better)75
SAD - Lite45.26Score (%, higher is better)70
SAD - Lite (Situating Prompt)50.08Score (%, higher is better)70

Interactive version: theaggregate.ai/model?slug=llama-3-70b-chat · How It Works · Data refreshed daily, snapshot 2026-09-19.