test1: benchmark results

Provider: Other. Access: Open.

Unified ELO 1256 ± 13, rank #2794 of 2928 rated models, from 79 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - HellaSwag89.52Normalized accuracy (%) (10-shot)99.4
Open LLM Leaderboard v1 - TruthfulQA MC278.32MC2 (%) (0-shot)98.9
Open LLM Leaderboard v1 - ARC Challenge72.27Normalized accuracy (%) (25-shot)91.5
Open LLM Leaderboard v1 - WinoGrande83.9Accuracy (%) (5-shot)91.1
Open LLM Leaderboard v1 - MMLU66.67Accuracy (%) (5-shot)87.9
Open LLM Leaderboard v1 - GSM8K64.67Accuracy (%) (5-shot)78.8
Open Korean LLM - KorNAT-Helpful48.75Normalized accuracy (%)72
MMLU-by-task - TruthfulQA MC248.33Accuracy (%)66.1
GAIA18.6Accuracy (%)57.6
Open Korean LLM - KorNAT-Harmless62.87Normalized accuracy (%)51.2
Open Korean LLM - Ko-GSM8K (flexible extract)19.64Exact match, flexible extract (%)51
MMLU-by-task - Econometrics28.07Accuracy (%)47.2

Interactive version: theaggregate.ai/model?slug=test1 · How It Works · Data refreshed daily, snapshot 2026-09-23.