K2 Think V2 — benchmark results

MBZUAI's open sovereign 70B reasoning model, RL-trained on the K2-V2 base. Provider: LLM360. Released 2026-01-08. Access: Open.

Unified ELO 1575 ± 23, rank #548 of 1776 rated models, from 37 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA IFBench62.79Accuracy (%)73.7
AA-LCR52.7Score (self-reported)67.1
AA Long Context Reasoning52.67Accuracy (%)61
AA Omniscience-33.92Score60.5
AA Humanity's Last Exam9.45Accuracy (%)59.6
AA GPQA Diamond71.31Accuracy (%)55.1
AA Omniscience - Software Engineering (SWE) - Kotlin20Accuracy (%)54.9
Artificial Analysis Intelligence Index17.26Intelligence Index53.7
AA SciCode32.99Accuracy (%)48.5
AA Omniscience - Software Engineering (SWE) - Julia12Accuracy (%)47.9
AA Omniscience - Software Engineering (SWE) - TypeScript20Accuracy (%)46
AA Omniscience - Software Engineering (SWE) - JavaScript28.18Accuracy (%)45.4

Interactive version: theaggregate.ai/model?slug=k2-think-v2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.