GPT-OSS-20B: benchmark results
OpenAI's open-weight GPT-OSS 20B, an Apache-2.0 sparse MoE (~3.6B active) reasoning model (August 2025). Provider: OpenAI. Released 2025-08-05. Access: Open.
Unified ELO 1525 ± 1, rank #571 of 1392 rated models, from 526 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| HELM Safety HarmBench | 98.7 | LM Evaluated Safety score (%) | 98.8 |
| MERA - ruMultiAr | 100 | EM (%) | 98.6 |
| Evals for Every Language - Language vai | 25 | Average Score (%) | 96.6 |
| RAI-Bench - Refusal Rate (General) | 84 | Rate (%) | 96.2 |
| HELM AIR-Bench | 86 | Refusal Rate (%) | 89.5 |
| HELM Safety Anthropic Red Team | 99.7 | LM Evaluated Safety score (%) | 88.4 |
| MERA - LCS | 39.6 | Accuracy (%) | 88 |
| ProLLM - Summarization | 83.1 | Score (%) | 87.9 |
| Enkrypt AI - Insecure Code Risk | 7.56 | Risk Score | 87.7 |
| MERA - MathLogicQA | 94.84 | Accuracy (%) | 86.1 |
| HELM Safety SimpleSafetyTests | 100 | LM Evaluated Safety score (%) | 86 |
| MERA - ruModAr | 94.3 | EM (%) | 85.6 |
Interactive version: theaggregate.ai/model?slug=gpt-oss-20b · How It Works · Data refreshed daily, snapshot 2026-09-05.