internlm2.5-7B-chat — benchmark results

Shanghai AI Lab's InternLM2.5 7B chat model, emphasizing math reasoning and agentic tool use, with a 1M-context sibling variant (July 2024). Provider: Shanghai AI Lab. Released 2024-06-27. Access: Open.

Unified ELO 1455 ± 31, rank #975 of 1776 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - BBH57.04Score98.8
Open LLM Leaderboard - GPQA12.98Score87
Open LLM Leaderboard - MuSR16.29Score85.3
Open LLM Leaderboard - MATH Level 525.3Score78.3
Mobile-MMLU64.3Overall Accuracy (%)71.4
Open LLM Leaderboard - IFEval55.39Score66.9
Open LLM Leaderboard - MMLU-Pro30.85Score64.1
Open PL LLM - Multiple Choice42.98Average Multiple-Choice Score (%)57
OlympicArena18.65Overall Accuracy (%)55.6
Open PL LLM Leaderboard45.16Average Score (%)53.5
Open PL LLM - Generative46.83Average Generative Score (%)47.9
Open PL LLM - RAG51.48Average RAG Score (%)42

Interactive version: theaggregate.ai/model?slug=internlm2-5-7b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.