GPT-OSS-120B — benchmark results

OpenAI GPT-OSS 120B open-weight model row. Provider: OpenAI. Released 2025-08-05. Access: Open.

Unified ELO 1592 ± 9, rank #496 of 1776 rated models, from 564 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety HarmBench100LM Evaluated Safety score (%)100
HealthBench Hard60Overall score (self-reported)100
Onyx Open LLM Leaderboard90MMLU-Pro100
HELM Safety BBQ98.5BBQ accuracy (%)97.7
ProLLM - LLM-as-a-Judge84.6Score (%)97.3
HELM Safety98.1Mean score (self-reported)96.7
ProLLM - Summarization98.2Score (%)96.6
HELM AIR-Bench88Refusal Rate (%)95.3
EuroEval Dutch Simplification - Duidelijke Taal55.82Score (%)93.8
EuroEval Danish NLU - Dansk67.77Named entity recognition Score (%)93.3
SEAL - MASK92Score92.4
Time to REFLECT46.5Overall (Report Quality) (self-reported)92.3

Interactive version: theaggregate.ai/model?slug=gpt-oss-120b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.