GPT-OSS-120B (Low) — benchmark results

GPT-OSS-120B evaluated at the low reasoning-effort setting. Provider: OpenAI. Released 2025-08-05. Access: Open.

Unified ELO 1604 ± 16, rank #472 of 1776 rated models, from 90 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Medmarks - SCTpublic70.41Score (%)90
Medmarks - PubMedQA77.4Score (%)87.9
Medmarks - Med-HALT Reasoning FCT86.7Score (%)87.1
Medmarks - PubHealthBench Reviewed87.89Score (%)85.7
Medmarks - Medbullets OP481.6Score (%)82.9
Medmarks - MedCalc-Bench66.09Score (%)81.4
AA LiveCodeBench70.69Pass@1 (%)80.8
Medmarks - MedXpertQA Reasoning28.93Score (%)78.6
Medmarks - MedXpertQA Understanding27.96Score (%)78.6
Medmarks - Medbullets OP576.08Score (%)78.6
AA Omniscience - Software Engineering (SWE) - Swift56Accuracy (%)77.6
Medmarks - MedQA88.61Score (%)72.9

Interactive version: theaggregate.ai/model?slug=gpt-oss-120b-low · How the rankings work · Data refreshed daily, snapshot 2026-07-22.