internlm2-7B — benchmark results

Shanghai AI Lab's 7B InternLM2 base model (January 2024), notable for near-perfect needle-in-a-haystack retrieval at 200K-token context. Provider: Shanghai AI Lab. Released 2024-01-12. Access: Open.

Unified ELO 1402 ± 20, rank #1213 of 1776 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - WinoGrande70.01Accuracy (%)91.5
Open LLM Leaderboard - GPQA11.56Score83.2
Open LLM Leaderboard - BBH40.28Score79.3
Open Chinese LLM - HellaSwag65.44Accuracy (%)78.9
Open LLM Leaderboard - MuSR14.33Score78.4
Open Chinese LLM Leaderboard59.83Average Score (%)69.7
Open Chinese LLM - GSM8K49.66Accuracy (%)65.9
Open Chinese LLM - ARC Challenge54.52Accuracy (%)65.7
Open Chinese LLM - CMMLU57.52Accuracy (%)64.4
Open Chinese LLM - C-Eval Semantic74.34Accuracy (%)63.5
Open CoT - LSAT Analytical Reasoning4.78CoT Gain (%)63
Open CoT - LSAT Reading Comprehension14.5CoT Gain (%)62.6

Interactive version: theaggregate.ai/model?slug=internlm2-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.