K-EXAONE-236B-A23B (Thinking): benchmark results

Provider: LG AI. Released 2025-12-31. Access: Open.

Unified ELO 1575 ± 1, rank #790 of 3078 rated models, from 100 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Nejumi 4 - Toxicity - Fairness99.44Criteria met (%)93.8
Nejumi 4 - Toxicity - Social Norms98.81Criteria met (%)90.8
Horangi 4 - Ko-HalluLens (Nonexistent Entities)94Refusal rate (%)89.9
Horangi 4 - HRM8K95Accuracy (%)85.6
Horangi 4 - HAE-RAE Bench (Reading Comprehension)90Accuracy (%)77.4
Nejumi 4 - BFCL - Live AST72.22Accuracy (%)76.8
Nejumi 4 - HalluLens96Hallucination resistance (%)75.4
Horangi 4 - IFEval-Ko88Instruction-following accuracy (%)73.1
Nejumi 4 - jaster (2-shot) - JSICK82Exact match (%)72.1
Horangi 4 - GLP - Mathematical Reasoning92.5Score (%)70.2
Horangi 4 - Ko-TruthfulQA85Accuracy (%)67.8
Horangi 4 - Ko-AIME 202590Accuracy (%)67.3

Interactive version: theaggregate.ai/model?slug=k-exaone-236b-a23b-thinking · How It Works · Data refreshed daily, snapshot 2026-09-19.