Yi-9B-200K — benchmark results

01.AI's 9B Yi base model with context extended to 200K tokens (March 2024), strong on code and math among similar-sized open models. Provider: 01.AI. Released 2024-03-15. Access: Open.

Unified ELO 1406 ± 23, rank #1195 of 1776 rated models, from 16 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - C-Eval Semantic82.92Accuracy (%)73.6
Open Chinese LLM - CMMLU62.82Accuracy (%)72.1
Open LLM Leaderboard - GPQA8.72Score71.9
Open LLM Leaderboard - MuSR12.11Score65.8
Open Chinese LLM - HellaSwag62.01Accuracy (%)65.6
Open Chinese LLM Leaderboard58.07Average Score (%)62
HELMET (128K)33.9Average Score59.7
Open LLM Leaderboard - MMLU-Pro29.13Score55.9
Open Chinese LLM - WinoGrande63.14Accuracy (%)53.6
Open Chinese LLM - ARC Challenge52.56Accuracy (%)50
Open LLM Leaderboard - BBH26.49Score41.5
BABILong (NIAH)41.3Avg Accuracy (%)41.4

Interactive version: theaggregate.ai/model?slug=yi-9b-200k · How the rankings work · Data refreshed daily, snapshot 2026-07-22.