test-llilu: benchmark results

Provider: Other. Access: Open.

Unified ELO 1455 ± 17, rank #1492 of 2656 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - Ko-GPQA-Diamond25.76Normalized accuracy (%)81.3
Open Korean LLM - Ko-GSM8K (flexible extract)33.13Exact match, flexible extract (%)66.9
Open Korean LLM - Ko-EQ-Bench20.17EQ-Bench score66.1
Open Ko-LLM Leaderboard38.23Average (%)65.4
Open Korean LLM Leaderboard38.23Average Score (%)65.4
Open Korean LLM - Ko-IFEval31.7Strict accuracy, prompt/instruction mean (%)60.7
Open Korean LLM - Ko-Winogrande59.91Accuracy (%)49.8
Open Korean LLM - KorNAT-CKA23.75Normalized accuracy (%)46.7
Open Korean LLM - KorNAT-Helpful45.25Normalized accuracy (%)35.3
Open Korean LLM - KorNAT-Harmless61.48Normalized accuracy (%)29.5

Interactive version: theaggregate.ai/model?slug=test-llilu · How It Works · Data refreshed daily, snapshot 2026-09-19.