luxia-21.4B-alignment-v1.2 — benchmark results

Saltlux's 21.4B DPO-aligned model on a passthrough depth-upscale of InternLM2-20B; its v1.x GSM8K gains drew contamination flags on the Open LLM Leaderboard (2024). Provider: Other. Released 2024-10-25. Access: Open.

Unified ELO 1468 ± 23, rank #916 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - WinoGrande73.72Accuracy (%)99.7
Open Chinese LLM - TruthfulQA MC69.57Accuracy (%)99.4
Open Chinese LLM - HellaSwag77.12Accuracy (%)98.8
Open Chinese LLM - ARC Challenge64.25Accuracy (%)95.8
Open Chinese LLM Leaderboard69.42Average Score (%)95.8
Open LLM Leaderboard - BBH47.77Score87.7
Open Chinese LLM - GSM8K58.38Accuracy (%)80.9
Open LLM Leaderboard - MuSR14.9Score80.6
Open Chinese LLM - C-Eval Semantic82.85Accuracy (%)73.3
Open Chinese LLM - CMMLU60.02Accuracy (%)68.5
Open LLM Leaderboard - GPQA7.72Score65.2
Open Korean LLM Leaderboard184.76Average Score (%)57.9

Interactive version: theaggregate.ai/model?slug=luxia-21-4b-alignment-v1-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.