InternLM2.5-Chat-7B: benchmark results

Shanghai AI Lab's InternLM2.5 7B chat model, emphasizing math reasoning and agentic tool use, with a 1M-context sibling variant (July 2024). Provider: Shanghai AI Lab. Released 2024-07-03. Access: Open.

Unified ELO 1494 ± 16, rank #1294 of 2928 rated models, from 206 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - BBH70.73Score99.3
OpenCompass Language - NLP - Chinese (CompassBench 2407)57.5Score (%)88.2
Open LLM Leaderboard - MuSR45.94Score87.3
Open LLM Leaderboard - GPQA34.73Score87
Open PL LLM - PSC (multiple choice, 5-shot)87.42Binary F1 (%)86.8
Open LLM Leaderboard - MATH Level 525.3Score78.2
SuperCLUE-DSPSafeBench - Overall77.64Score77.3
OpenCompass Language - NLP - Chinese (CompassBench 2409)52.3Score (%)75.9
OpenCompass LLM - Language - Chinese (CompassBench 2407)50.5Score (%)73.5
Mobile-MMLU64.3Overall Accuracy (%)71.4
Open PL LLM - PSC (generative, 5-shot)95.15Binary F1 (%)71.2
OpenCompass Language - Dialogue - Chinese (CompassBench 2407)52.4Score (%)70.6

Interactive version: theaggregate.ai/model?slug=internlm2-5-chat-7b · How It Works · Data refreshed daily, snapshot 2026-09-23.