Peagle-9B: benchmark results
Provider: Other. Released 2024-04-01. Access: Open.
Unified ELO 1480 ± 14, rank #1281 of 2656 rated models, from 34 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Korean LLM - KorNAT-Harmless | 73.75 | Normalized accuracy (%) | 96.7 |
| Open Korean LLM - KorNAT-Helpful | 52.48 | Normalized accuracy (%) | 93.2 |
| Open Chinese LLM - TruthfulQA MC | 59.78 | Accuracy (%) | 82.2 |
| Open Korean LLM Leaderboard | 41.22 | Average Score (%) | 81.7 |
| Open Ko-LLM Leaderboard | 41.22 | Average (%) | 81.6 |
| Open Korean LLM - KorNAT-CKA | 29.34 | Normalized accuracy (%) | 79.3 |
| Open Korean LLM - Ko-GSM8K (flexible extract) | 41.47 | Exact match, flexible extract (%) | 76.1 |
| Open Korean LLM - Ko-EQ-Bench | 25.4 | EQ-Bench score | 71.3 |
| Open Korean LLM - Ko-GPQA-Diamond | 24.75 | Normalized accuracy (%) | 69.5 |
| Open Korean LLM - Ko-Winogrande | 62.27 | Accuracy (%) | 67.7 |
| Open Korean LLM - Ko-IFEval | 33.57 | Strict accuracy, prompt/instruction mean (%) | 67.6 |
| Open Medical LLM - MMLU College Medicine | 62.43 | Accuracy (%) | 51.7 |
Interactive version: theaggregate.ai/model?slug=peagle-9b · How It Works · Data refreshed daily, snapshot 2026-09-19.