luxia-21.4B-alignment-v1.2 — benchmark results
Saltlux's 21.4B DPO-aligned model on a passthrough depth-upscale of InternLM2-20B; its v1.x GSM8K gains drew contamination flags on the Open LLM Leaderboard (2024). Provider: Other. Released 2024-10-25. Access: Open.
Unified ELO 1468 ± 23, rank #916 of 1776 rated models, from 15 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Chinese LLM - WinoGrande | 73.72 | Accuracy (%) | 99.7 |
| Open Chinese LLM - TruthfulQA MC | 69.57 | Accuracy (%) | 99.4 |
| Open Chinese LLM - HellaSwag | 77.12 | Accuracy (%) | 98.8 |
| Open Chinese LLM - ARC Challenge | 64.25 | Accuracy (%) | 95.8 |
| Open Chinese LLM Leaderboard | 69.42 | Average Score (%) | 95.8 |
| Open LLM Leaderboard - BBH | 47.77 | Score | 87.7 |
| Open Chinese LLM - GSM8K | 58.38 | Accuracy (%) | 80.9 |
| Open LLM Leaderboard - MuSR | 14.9 | Score | 80.6 |
| Open Chinese LLM - C-Eval Semantic | 82.85 | Accuracy (%) | 73.3 |
| Open Chinese LLM - CMMLU | 60.02 | Accuracy (%) | 68.5 |
| Open LLM Leaderboard - GPQA | 7.72 | Score | 65.2 |
| Open Korean LLM Leaderboard | 184.76 | Average Score (%) | 57.9 |
Interactive version: theaggregate.ai/model?slug=luxia-21-4b-alignment-v1-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.