Mistral Large 3: benchmark results

Mistral AI's Large 3, a 675B sparse MoE (41B active) flagship (December 2025). Provider: Mistral. Released 2025-12-02. Access: API.

Unified ELO 1563 ± 1, rank #391 of 1392 rated models, from 320 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
LLM Stats (MM-MT-Bench)84.9Score (%)100
ROK-FORTRESS28.4Δ_ling (pp) (self-reported)100
SpeechMap Compliance98.2% Requests Completed99.1
UGI Leaderboard56.86UGI Score97.7
AGC-Bench - ocw1.63Dataset z-score97.6
StereoTales109Emissions (self-reported)95.5
AGC-Bench - cpers1.14Dataset z-score93.9
AGC-Bench - mops1.46Dataset z-score93.9
LLM Stats (Wild Bench)68.5Score (%)92.9
AA Omniscience - Software Engineering (SWE) - Java30Accuracy (%)90.4
AGC-Bench - thenextchapter1.13Dataset z-score90.2
AA Omniscience - Software Engineering (SWE) - Kotlin36Accuracy (%)89.4

Interactive version: theaggregate.ai/model?slug=mistral-large-3 · How It Works · Data refreshed daily, snapshot 2026-09-05.