GPT-OSS-20B: benchmark results

OpenAI's open-weight GPT-OSS 20B, an Apache-2.0 sparse MoE (~3.6B active) reasoning model (August 2025). Provider: OpenAI. Released 2025-08-05. Access: Open.

Unified ELO 1525 ± 1, rank #571 of 1392 rated models, from 526 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety HarmBench98.7LM Evaluated Safety score (%)98.8
MERA - ruMultiAr100EM (%)98.6
Evals for Every Language - Language vai25Average Score (%)96.6
RAI-Bench - Refusal Rate (General)84Rate (%)96.2
HELM AIR-Bench86Refusal Rate (%)89.5
HELM Safety Anthropic Red Team99.7LM Evaluated Safety score (%)88.4
MERA - LCS39.6Accuracy (%)88
ProLLM - Summarization83.1Score (%)87.9
Enkrypt AI - Insecure Code Risk7.56Risk Score87.7
MERA - MathLogicQA94.84Accuracy (%)86.1
HELM Safety SimpleSafetyTests100LM Evaluated Safety score (%)86
MERA - ruModAr94.3EM (%)85.6

Interactive version: theaggregate.ai/model?slug=gpt-oss-20b · How It Works · Data refreshed daily, snapshot 2026-09-05.