internlm2-20B — benchmark results

Shanghai AI Lab's 20B InternLM2 base model, pretrained on over 2.3T tokens of English, Chinese, and code with a 200k context window (January 2024). Provider: Shanghai AI Lab. Released 2024-01-12. Access: Open.

Unified ELO 1456 ± 16, rank #969 of 1776 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - WinoGrande72.69Accuracy (%)99.4
Open Chinese LLM - HellaSwag68.28Accuracy (%)86.6
Open Chinese LLM - ARC Challenge58.87Accuracy (%)81.9
Open Chinese LLM - GSM8K57.62Accuracy (%)80
Open Chinese LLM Leaderboard63.91Average Score (%)77.4
Science Leaderboard43.3Average Accuracy (%)71.2
Open Chinese LLM - C-Eval Semantic80.77Accuracy (%)69.7
Open Chinese LLM - CMMLU60.11Accuracy (%)69.1
Open PL LLM - Multiple Choice43.01Average Multiple-Choice Score (%)57.3
Open PL LLM Leaderboard47.15Average Score (%)55.2
Open PL LLM - Generative50.33Average Generative Score (%)53.8
Open PL LLM - RAG57.29Average RAG Score (%)52.1

Interactive version: theaggregate.ai/model?slug=internlm2-20b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.