internlm2-chat-7B — benchmark results

Shanghai AI Lab's 7B InternLM2 chat model (January 2024) with 200K context. Provider: Shanghai AI Lab. Released 2024-01-10. Access: Open.

Unified ELO 1445 ± 18, rank #1023 of 1776 rated models, from 25 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SALAD-Bench Base97.7Safety Score (%)93.9
Open CoT - LSAT Reading Comprehension21.56CoT Gain (%)91.6
Open Chinese LLM - WinoGrande67.4Accuracy (%)82.5
Open CoT - LSAT Logical Reasoning17.45CoT Gain (%)81.7
Open CoT Leaderboard11.89Average CoT Gain (%)79.4
Open CoT - LSAT Analytical Reasoning6.09CoT Gain (%)76.7
SALAD-Bench58.99Average Safety Score (%)75.8
Open Chinese LLM - HellaSwag63.02Accuracy (%)71.5
Open Chinese LLM Leaderboard60.49Average Score (%)71.5
Open CoT - LogiQA 210.18CoT Gain (%)71
Open Chinese LLM - GSM8K50.57Accuracy (%)68.8
Open Chinese LLM - C-Eval Semantic79.44Accuracy (%)68.5

Interactive version: theaggregate.ai/model?slug=internlm2-chat-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.