K-EXAONE (Thinking): benchmark results
LG AI Research's open-weight K-EXAONE-236B-A23B (December 2025), a 236-billion-parameter, 23-billion-active MoE model covering six languages with a 256K context and Multi-Token Prediction for faster decoding. Provider: LG AI. Released 2025-12-31. Access: Open.
Unified ELO 1555 ± 1, rank #637 of 2032 rated models, from 108 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - Toxicity - Fairness | 99.44 | Criteria met (%) | 93.8 |
| Nejumi 4 - Toxicity - Social Norms | 98.81 | Criteria met (%) | 90.8 |
| Horangi 4 - Ko-HalluLens (Nonexistent Entities) | 94 | Refusal rate (%) | 89.9 |
| Korean CSAT 2026 (Easy Mode) - Mathematics | 100 | Points (out of 100) | 88.4 |
| Horangi 4 - HRM8K | 95 | Accuracy (%) | 85.6 |
| Horangi 4 - HAE-RAE Bench (Reading Comprehension) | 90 | Accuracy (%) | 77.4 |
| Nejumi 4 - BFCL - Live AST | 72.22 | Accuracy (%) | 76.8 |
| Nejumi 4 - HalluLens | 96 | Hallucination resistance (%) | 75.4 |
| Horangi 4 - IFEval-Ko | 88 | Instruction-following accuracy (%) | 73.1 |
| Nejumi 4 - jaster (2-shot) - JSICK | 82 | Exact match (%) | 72.1 |
| Horangi 4 - GLP - Mathematical Reasoning | 92.5 | Score (%) | 70.2 |
| Horangi 4 - Ko-TruthfulQA | 85 | Accuracy (%) | 67.8 |
Interactive version: theaggregate.ai/model?slug=k-exaone-thinking · How It Works · Data refreshed daily, snapshot 2026-09-26.