GPT-OSS-120B: benchmark results

OpenAI's open-weight GPT-OSS 120B, an Apache-2.0 sparse MoE (~5B active) reasoning model (August 2025). Provider: OpenAI. Released 2025-08-05. Access: Open.

Unified ELO 1578 ± 1, rank #325 of 1392 rated models, from 658 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety HarmBench100LM Evaluated Safety score (%)100
HealthBench Hard60Overall score (self-reported)100
Onyx Open LLM Leaderboard90MMLU-Pro100
Enkrypt AI - Insecure Code Risk1.33Risk Score98.1
HELM Safety BBQ98.5BBQ accuracy (%)97.7
ProLLM - LLM-as-a-Judge84.6Score (%)97.3
HELM Safety98.1Mean score (self-reported)97
ProLLM - Summarization98.2Score (%)96.6
HELM AIR-Bench88Refusal Rate (%)95.3
EuroEval Dutch Simplification - Duidelijke Taal55.82Score (%)93.8
EuroEval Danish NLU - Dansk67.77Named entity recognition Score (%)93.3
SEAL - MASK92Score92.4

Interactive version: theaggregate.ai/model?slug=gpt-oss-120b · How It Works · Data refreshed daily, snapshot 2026-09-05.