chinese-alpaca-2-13B-16k: benchmark results

Provider: Other. Access: Open.

Unified ELO 1402 ± 16, rank #2126 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - GSM8K21.08Accuracy (%) (5-shot)41.7
Open Chinese LLM - TruthfulQA MC52.24Accuracy (%)35.9
Open LLM Leaderboard v1 - TruthfulQA MC246.5MC2 (%) (0-shot)34.7
Open Chinese LLM - WinoGrande61.88Accuracy (%)32.9
Open LLM Leaderboard v1 - ARC Challenge55.03Normalized accuracy (%) (25-shot)32.6
Open LLM Leaderboard v1 - WinoGrande73.4Accuracy (%) (5-shot)31.9
Open Chinese LLM - ARC Challenge47.78Accuracy (%)31.6
Open Chinese LLM - HellaSwag56.98Accuracy (%)31.2
Open LLM Leaderboard v1 - HellaSwag77.41Normalized accuracy (%) (10-shot)30.9
Open LLM Leaderboard v1 - MMLU51.28Accuracy (%) (5-shot)30.6
Open Chinese LLM - GSM8K17.66Accuracy (%)12.5
Open Chinese LLM Leaderboard46.46Average Score (%)9.5

Interactive version: theaggregate.ai/model?slug=chinese-alpaca-2-13b-16k · How It Works · Data refreshed daily, snapshot 2026-09-23.