Nanbeige2-16B-Chat — benchmark results

Nanbeige Lab's 16B chat model trained on 4.5T tokens and aligned with 1M-sample SFT, curriculum learning, and DPO (May 2024). Provider: Nanbeige. Released 2024-05-24. Access: Open.

Unified ELO 1447 ± 21, rank #1013 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - ARC Challenge60.32Accuracy (%)88.1
AlpacaEval 2.040.59LC Win Rate (%)81.5
Open Chinese LLM - GSM8K57.47Accuracy (%)79.5
Open Chinese LLM Leaderboard59.82Average Score (%)69.4
Open Chinese LLM - TruthfulQA MC56.07Accuracy (%)65.6
Open Chinese LLM - C-Eval Semantic72.4Accuracy (%)59.1
Open Chinese LLM - HellaSwag60.48Accuracy (%)52.8
Open Chinese LLM - WinoGrande62.43Accuracy (%)43.3
Open Chinese LLM - CMMLU49.54Accuracy (%)31.5

Interactive version: theaggregate.ai/model?slug=nanbeige2-16b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.