GPT-OSS-20B — benchmark results

OpenAI GPT-OSS 20B open-weight model row. Provider: OpenAI. Released 2025-08-05. Access: Open.

Unified ELO 1523 ± 11, rank #707 of 1776 rated models, from 454 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
HELM Safety HarmBench98.7LM Evaluated Safety score (%)98.8
Evals for Every Language - Language vai25Average Score (%)96.6
HELM AIR-Bench86Refusal Rate (%)89.5
HELM Safety Anthropic Red Team99.7LM Evaluated Safety score (%)88.4
ProLLM - Summarization83.1Score (%)87.9
HELM Safety SimpleSafetyTests100LM Evaluated Safety score (%)86
HELM Safety BBQ96.7BBQ accuracy (%)83.7
Vellum - AIME 202598.7Accuracy (%)82.1
Vals AI MATH 50094.2Accuracy (%)80.9
DuckDB-NSQL66.7Execution Accuracy (%)80.7
SEAL - MASK86.46Score80.3
CritPt1.4Accuracy (self-reported)80.1

Interactive version: theaggregate.ai/model?slug=gpt-oss-20b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.