test1: benchmark results
Provider: Other. Access: Open.
Unified ELO 1256 ± 13, rank #2794 of 2928 rated models, from 79 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard v1 - HellaSwag | 89.52 | Normalized accuracy (%) (10-shot) | 99.4 |
| Open LLM Leaderboard v1 - TruthfulQA MC2 | 78.32 | MC2 (%) (0-shot) | 98.9 |
| Open LLM Leaderboard v1 - ARC Challenge | 72.27 | Normalized accuracy (%) (25-shot) | 91.5 |
| Open LLM Leaderboard v1 - WinoGrande | 83.9 | Accuracy (%) (5-shot) | 91.1 |
| Open LLM Leaderboard v1 - MMLU | 66.67 | Accuracy (%) (5-shot) | 87.9 |
| Open LLM Leaderboard v1 - GSM8K | 64.67 | Accuracy (%) (5-shot) | 78.8 |
| Open Korean LLM - KorNAT-Helpful | 48.75 | Normalized accuracy (%) | 72 |
| MMLU-by-task - TruthfulQA MC2 | 48.33 | Accuracy (%) | 66.1 |
| GAIA | 18.6 | Accuracy (%) | 57.6 |
| Open Korean LLM - KorNAT-Harmless | 62.87 | Normalized accuracy (%) | 51.2 |
| Open Korean LLM - Ko-GSM8K (flexible extract) | 19.64 | Exact match, flexible extract (%) | 51 |
| MMLU-by-task - Econometrics | 28.07 | Accuracy (%) | 47.2 |
Interactive version: theaggregate.ai/model?slug=test1 · How It Works · Data refreshed daily, snapshot 2026-09-23.