GritLM-8x7B-KTO — benchmark results

Contextual AI's KTO-tuned GritLM 8x7B, a Mixtral-based GRIT model that unifies text generation and embedding in one checkpoint. Provider: Other. Released 2024-04-17. Access: Open.

Unified ELO 1432 ± 8, rank #1081 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - BBH40.83Score79.8
Open Chinese LLM - WinoGrande65.59Accuracy (%)73.3
Open LLM Leaderboard - IFEval57.14Score69
Open Chinese LLM - ARC Challenge54.35Accuracy (%)65.3
Open Chinese LLM Leaderboard58.43Average Score (%)64.7
Open LLM Leaderboard - MuSR11.67Score62.4
Open Chinese LLM - HellaSwag61.31Accuracy (%)62
Open Chinese LLM - C-Eval Semantic72.97Accuracy (%)60.5
Open Chinese LLM - CMMLU56.28Accuracy (%)60.5
Open LLM Leaderboard - MMLU-Pro29.42Score56.8
Open LLM Leaderboard - MATH Level 512.24Score55
Open LLM Leaderboard - GPQA6.15Score51.6

Interactive version: theaggregate.ai/model?slug=gritlm-8x7b-kto · How the rankings work · Data refreshed daily, snapshot 2026-07-22.