GPT-OSS-120B (Low): benchmark results

GPT-OSS-120B evaluated at the low reasoning-effort setting. Provider: OpenAI. Released 2025-08-05. Access: Open.

Unified ELO 1510 ± 1, rank #804 of 1761 rated models, from 91 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - Swift60Accuracy (%)94.4
Medmarks - SCTpublic70.41Score (%)90
Medmarks - PubMedQA77.4Score (%)87.9
Medmarks - Med-HALT Reasoning FCT86.7Score (%)87.1
Medmarks - PubHealthBench Reviewed87.89Score (%)85.7
Medmarks - Medbullets OP481.6Score (%)82.9
Medmarks - MedCalc-Bench66.09Score (%)81.4
Medmarks - MedXpertQA Reasoning28.93Score (%)78.6
Medmarks - MedXpertQA Understanding27.96Score (%)78.6
Medmarks - Medbullets OP576.08Score (%)78.6
AA LiveCodeBench70.69Pass@1 (%)74.7
Medmarks - MedQA88.61Score (%)72.9

Interactive version: theaggregate.ai/model?slug=gpt-oss-120b-low · How It Works · Data refreshed daily, snapshot 2026-09-05.