Llama 3.2 90B Instruct — benchmark results

Meta's largest open vision model: Llama 3.1 70B with a cross-attention image adapter, tuned for visual reasoning and captioning (September 2024). Provider: Meta. Released 2024-09-25. Access: Open.

Unified ELO 1504 ± 22, rank #784 of 1776 rated models, from 26 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
LLM Stats (AI2D)92.3Score (%)71
BALROG BabaIsAI (LLM)43.9Progress (%)69.7
BALROG BabyAI (VLM)66Progress (%)63.6
BALROG BabyAI (LLM)72Progress (%)62.1
BALROG BabaIsAI (VLM)21.9Progress (%)60
BALROG Crafter (LLM)31.7Progress (%)57.6
LLM Stats (ChartQA)85.5Score (%)47.8
BALROG TextWorld (LLM)11.2Progress (%)37.9
BALROG MiniHack (LLM)5Progress (%)31.8
AA Humanity's Last Exam4.92Accuracy (%)31.6
AA MMLU-Pro67.1Accuracy (%)29.7
LLM Stats (TextVQA)73.5Score (%)28.6

Interactive version: theaggregate.ai/model?slug=llama-3-2-90b-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.