internlm2-base-20B: benchmark results

Provider: Shanghai AI Lab. Access: Open.

Unified ELO 1506 ± 33, rank #1057 of 2656 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - HellaSwag66.96Accuracy (%)82.2
Open Chinese LLM - ARC Challenge58.11Accuracy (%)78.8
Open Chinese LLM - WinoGrande65.9Accuracy (%)75.2
Open Chinese LLM Leaderboard59.56Average Score (%)68
Open Chinese LLM - C-Eval Semantic74.84Accuracy (%)65
Open Chinese LLM - CMMLU57.61Accuracy (%)65
Open Portuguese LLM - ASSIN2 RTE91.13Macro F1 (%)64.1
Open Portuguese LLM - ENEM63.05Accuracy (%)54.4
Open Portuguese LLM - BLUEX52.57Accuracy (%)53.3
Open Portuguese LLM - OAB Exams42.6Accuracy (%)52.2
Open Chinese LLM - GSM8K45.79Accuracy (%)50.6
Open Portuguese LLM - FaQuAD NLI55.97Macro F1 (%)38.4

Interactive version: theaggregate.ai/model?slug=internlm2-base-20b · How It Works · Data refreshed daily, snapshot 2026-09-19.