internlm2-chat-7B: benchmark results

Shanghai AI Lab's 7B InternLM2 chat model (January 2024) with 200K context. Provider: Shanghai AI Lab. Released 2024-01-10. Access: Open.

Unified ELO 1450 ± 1, rank #944 of 1392 rated models, from 26 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
SALAD-Bench Base97.7Safety Score (%)93.9
Open CoT - LSAT Reading Comprehension21.56CoT Gain (%)91.6
Open Chinese LLM - WinoGrande67.4Accuracy (%)82.5
Open CoT - LSAT Logical Reasoning17.45CoT Gain (%)81.7
Open CoT Leaderboard11.89Average CoT Gain (%)79.4
Open CoT - LSAT Analytical Reasoning6.09CoT Gain (%)76.7
SALAD-Bench58.99Average Safety Score (%)75.8
Open Chinese LLM - HellaSwag63.02Accuracy (%)71.5
Open Chinese LLM Leaderboard60.49Average Score (%)71.5
Open CoT - LogiQA 210.18CoT Gain (%)71
Open Chinese LLM - GSM8K50.57Accuracy (%)68.8
Open Chinese LLM - C-Eval Semantic79.44Accuracy (%)68.5

Interactive version: theaggregate.ai/model?slug=internlm2-chat-7b · How It Works · Data refreshed daily, snapshot 2026-09-05.