K-EXAONE-236B-A23B (Thinking): benchmark results
Provider: LG AI. Released 2025-12-31. Access: Open.
Unified ELO 1575 ± 1, rank #790 of 3078 rated models, from 100 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Nejumi 4 - Toxicity - Fairness | 99.44 | Criteria met (%) | 93.8 |
| Nejumi 4 - Toxicity - Social Norms | 98.81 | Criteria met (%) | 90.8 |
| Horangi 4 - Ko-HalluLens (Nonexistent Entities) | 94 | Refusal rate (%) | 89.9 |
| Horangi 4 - HRM8K | 95 | Accuracy (%) | 85.6 |
| Horangi 4 - HAE-RAE Bench (Reading Comprehension) | 90 | Accuracy (%) | 77.4 |
| Nejumi 4 - BFCL - Live AST | 72.22 | Accuracy (%) | 76.8 |
| Nejumi 4 - HalluLens | 96 | Hallucination resistance (%) | 75.4 |
| Horangi 4 - IFEval-Ko | 88 | Instruction-following accuracy (%) | 73.1 |
| Nejumi 4 - jaster (2-shot) - JSICK | 82 | Exact match (%) | 72.1 |
| Horangi 4 - GLP - Mathematical Reasoning | 92.5 | Score (%) | 70.2 |
| Horangi 4 - Ko-TruthfulQA | 85 | Accuracy (%) | 67.8 |
| Horangi 4 - Ko-AIME 2025 | 90 | Accuracy (%) | 67.3 |
Interactive version: theaggregate.ai/model?slug=k-exaone-236b-a23b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.