GPT-OSS-120B (Medium): benchmark results

GPT-OSS-120B evaluated at the medium reasoning-effort setting. Provider: OpenAI. Released 2025-08-05. Access: Open.

Unified ELO 1560 ± 1, rank #597 of 1761 rated models, from 46 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Medmarks - PubMedQA78.13Score (%)92.9
Medmarks - SCTpublic71.35Score (%)92.9
Medmarks - Med-HALT Reasoning FCT87.96Score (%)91.4
Medmarks - MedQA91.54Score (%)90
Medmarks - MedCalc-Bench68.91Score (%)88.6
Medmarks - Medbullets OP484.31Score (%)88.6
Medmarks - Medbullets OP580.95Score (%)88.6
Medmarks - PubHealthBench Reviewed88.25Score (%)87.9
Medmarks - MedXpertQA Reasoning35.59Score (%)87.1
Medmarks - MetaMedQA77.3Score (%)87.1
SLR-Bench - Basic100Accuracy (%)86.4
LiveOIBench57.55Avg Human Percentile86

Interactive version: theaggregate.ai/model?slug=gpt-oss-120b-medium · How It Works · Data refreshed daily, snapshot 2026-09-05.