GPT-5.2 (2025-12-11) (xHigh): benchmark results
Provider: OpenAI. Released 2025-12-11. Access: API.
Unified ELO 1778 ± 13, rank #179 of 2131 rated models, from 148 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Context-Bench Skills | 85.31 | Task Completion (%) | 100 |
| Nejumi 4 - Toxicity - Social Norms | 99.6 | Criteria met (%) | 98.6 |
| Nejumi 4 - jaster (2-shot) - MGSM | 95 | Exact match (%) | 98.6 |
| Nejumi 4 - jaster (0-shot) - MMLU-ProX (Japanese) | 91 | Exact match (%) | 97.9 |
| Nejumi 4 - Toxicity - Prohibited Acts | 98.44 | Criteria met (%) | 96.5 |
| Horangi 4 - Ko-AIME 2025 | 100 | Accuracy (%) | 96.2 |
| Horangi 4 - Ko-ARC-AGI | 92.71 | Accuracy (%) | 95.2 |
| Chess Puzzles (Epoch AI) | 49 | Accuracy (%) | 94.9 |
| Horangi 4 - HAE-RAE Bench (without Reading Comprehension) | 98.99 | Accuracy (%) | 94.7 |
| Horangi 4 - GLP - Mathematical Reasoning | 97 | Score (%) | 94.2 |
| Horangi 4 - GLP - General Knowledge | 94.49 | Score (%) | 93.8 |
| Horangi 4 - HAE-RAE Bench (Reading Comprehension) | 92 | Accuracy (%) | 93.8 |
Interactive version: theaggregate.ai/model?slug=gpt-5-2-2025-12-11-xhigh · How It Works · Data refreshed daily, snapshot 2026-10-09.