internlm2.5-7B-chat: benchmark results

Shanghai AI Lab's InternLM2.5 7B chat model, emphasizing math reasoning and agentic tool use, with a 1M-context sibling variant (July 2024). Provider: Shanghai AI Lab. Released 2024-06-27. Access: Open.

Unified ELO 1414 ± 1, rank #1087 of 1392 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - BBH57.04Score98.8
Open LLM Leaderboard - GPQA12.98Score87
Open LLM Leaderboard - MuSR16.29Score85.3
Open LLM Leaderboard - MATH Level 525.3Score78.2
Mobile-MMLU64.3Overall Accuracy (%)71.4
Open LLM Leaderboard - IFEval55.39Score66.9
Open LLM Leaderboard - MMLU-Pro30.85Score64.1
Open PL LLM - Multiple Choice42.98Average Multiple-Choice Score (%)57
OlympicArena18.65Overall Accuracy (%)55.6
Open PL LLM Leaderboard45.16Average Score (%)53.5
Open PL LLM - Generative46.83Average Generative Score (%)47.9
Open PL LLM - RAG51.48Average RAG Score (%)42

Interactive version: theaggregate.ai/model?slug=internlm2-5-7b-chat · How It Works · Data refreshed daily, snapshot 2026-09-05.