internlm2-base-7B — benchmark results

Provider: Shanghai AI Lab. Released 2024-01-12. Access: Open.

Unified ELO 1365 ± 17, rank #1361 of 1776 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - HellaSwag63.75Accuracy (%)74.2
Open Chinese LLM - WinoGrande65.43Accuracy (%)72.7
Open Chinese LLM - ARC Challenge52.56Accuracy (%)50
Open PL LLM - Multiple Choice20.46Average Multiple-Choice Score (%)29.7
Open PL LLM - Generative29.7Average Generative Score (%)29.4
Open PL LLM Leaderboard25.68Average Score (%)29
Open PL LLM - RAG38.54Average RAG Score (%)26.6
Open Chinese LLM Leaderboard50.44Average Score (%)20.8
Open Chinese LLM - GSM8K24.87Accuracy (%)18.5
Open Chinese LLM - CMMLU46.48Accuracy (%)17.2
Open Chinese LLM - C-Eval Semantic54.73Accuracy (%)14.8
Open Chinese LLM - TruthfulQA MC45.27Accuracy (%)4.2

Interactive version: theaggregate.ai/model?slug=internlm2-base-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.