GPT-OSS-20B — benchmark results
OpenAI GPT-OSS 20B open-weight model row. Provider: OpenAI. Released 2025-08-05. Access: Open.
Unified ELO 1523 ± 11, rank #707 of 1776 rated models, from 454 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM Safety HarmBench | 98.7 | LM Evaluated Safety score (%) | 98.8 |
| Evals for Every Language - Language vai | 25 | Average Score (%) | 96.6 |
| HELM AIR-Bench | 86 | Refusal Rate (%) | 89.5 |
| HELM Safety Anthropic Red Team | 99.7 | LM Evaluated Safety score (%) | 88.4 |
| ProLLM - Summarization | 83.1 | Score (%) | 87.9 |
| HELM Safety SimpleSafetyTests | 100 | LM Evaluated Safety score (%) | 86 |
| HELM Safety BBQ | 96.7 | BBQ accuracy (%) | 83.7 |
| Vellum - AIME 2025 | 98.7 | Accuracy (%) | 82.1 |
| Vals AI MATH 500 | 94.2 | Accuracy (%) | 80.9 |
| DuckDB-NSQL | 66.7 | Execution Accuracy (%) | 80.7 |
| SEAL - MASK | 86.46 | Score | 80.3 |
| CritPt | 1.4 | Accuracy (self-reported) | 80.1 |
Interactive version: theaggregate.ai/model?slug=gpt-oss-20b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.