K2-Chat: benchmark results

LLM360's chat fine-tune of its fully open 65B K2 model, a reproducible LLM claimed to beat Llama 2 70B Chat using 35% less compute (2024). Provider: LLM360. Released 2024-05-22. Access: Open.

Unified ELO 1508 ± 1, rank #661 of 1392 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - MuSR16.82Score86.9
Enkrypt AI - Insecure Code Risk13.78Risk Score76.9
Enkrypt AI - Risk Score27.61Risk Score68.2
Open LLM Leaderboard - BBH33.79Score66.4
Open LLM Leaderboard - GPQA7.49Score63.2
Enkrypt AI - Jailbreak Risk7.04Risk Score62.8
Open LLM Leaderboard - IFEval51.52Score61.4
Enkrypt AI - Safety Risk23.94Risk Score60.3
Open LLM Leaderboard - MATH Level 510.35Score48.5
Open LLM Leaderboard - MMLU-Pro26.34Score48.1
Enkrypt AI - Toxicity Risk5.59Risk Score30.9
Enkrypt AI - Bias Risk87.34Risk Score25.9

Interactive version: theaggregate.ai/model?slug=k2-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.