kayfour-Qwen2.5-7B-Instruct-testv1: benchmark results

Provider: Other. Access: Open.

Unified ELO 1556 ± 17, rank #818 of 2656 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - Ko-IFEval63.99Strict accuracy, prompt/instruction mean (%)97.9
Open Korean LLM - Ko-GSM8K (flexible extract)67.1Exact match, flexible extract (%)96.6
Open Korean LLM - KorNAT-Helpful54.2Normalized accuracy (%)95
Open Korean LLM - Ko-EQ-Bench47.77EQ-Bench score94.4
Open Korean LLM - KorNAT-Harmless71.56Normalized accuracy (%)94.2
Open Korean LLM Leaderboard46.8Average Score (%)94.1
Open Ko-LLM Leaderboard46.8Average (%)94
Open Korean LLM - KorNAT-CKA30.38Normalized accuracy (%)83
Open Korean LLM - Ko-Winogrande60.54Accuracy (%)55.1
Open Korean LLM - Ko-GPQA-Diamond21.72Normalized accuracy (%)29.4

Interactive version: theaggregate.ai/model?slug=kayfour-qwen2-5-7b-instruct-testv1 · How It Works · Data refreshed daily, snapshot 2026-09-19.