deep-solar-eeve-KorSTS: benchmark results

Provider: Other. Access: Open.

Unified ELO 1404 ± 17, rank #1876 of 2656 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Korean LLM - Ko-Winogrande65.67Accuracy (%)85.7
Open Korean LLM - KorNAT-CKA27.05Normalized accuracy (%)67.4
Open Korean LLM - KorNAT-Helpful47.8Normalized accuracy (%)60.8
Open Korean LLM - Ko-GPQA-Diamond23.74Normalized accuracy (%)55.6
Open Korean LLM Leaderboard33.69Average Score (%)43.5
Open Ko-LLM Leaderboard33.69Average (%)43.3
Open Korean LLM - KorNAT-Harmless62.27Normalized accuracy (%)41.1
Open Korean LLM - Ko-IFEval24.64Strict accuracy, prompt/instruction mean (%)30.8
Open Korean LLM - Ko-EQ-Bench0EQ-Bench score24.5
Open Korean LLM - Ko-GSM8K (flexible extract)1.52Exact match, flexible extract (%)13.9

Interactive version: theaggregate.ai/model?slug=deep-solar-eeve-korsts · How It Works · Data refreshed daily, snapshot 2026-09-19.