GPT-OSS-120B (Medium) — benchmark results

GPT-OSS-120B evaluated at the medium reasoning-effort setting. Provider: OpenAI. Released 2025-08-05. Access: Open.

Unified ELO 1651 ± 24, rank #364 of 1776 rated models, from 40 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Medmarks - PubMedQA78.13Score (%)92.9
Medmarks - SCTpublic71.35Score (%)92.9
Medmarks - Med-HALT Reasoning FCT87.96Score (%)91.4
Medmarks - MedQA91.54Score (%)90
Medmarks - MedCalc-Bench68.91Score (%)88.6
Medmarks - Medbullets OP484.31Score (%)88.6
Medmarks - Medbullets OP580.95Score (%)88.6
Medmarks - PubHealthBench Reviewed88.25Score (%)87.9
Medmarks - MedXpertQA Reasoning35.59Score (%)87.1
Medmarks - MetaMedQA77.3Score (%)87.1
SLR-Bench - Basic100Accuracy (%)86.4
LiveOIBench57.55Avg Human Percentile86

Interactive version: theaggregate.ai/model?slug=gpt-oss-120b-medium · How the rankings work · Data refreshed daily, snapshot 2026-07-22.