internlm2.5-7B-chat — benchmark results
Shanghai AI Lab's InternLM2.5 7B chat model, emphasizing math reasoning and agentic tool use, with a 1M-context sibling variant (July 2024). Provider: Shanghai AI Lab. Released 2024-06-27. Access: Open.
Unified ELO 1455 ± 31, rank #975 of 1776 rated models, from 15 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - BBH | 57.04 | Score | 98.8 |
| Open LLM Leaderboard - GPQA | 12.98 | Score | 87 |
| Open LLM Leaderboard - MuSR | 16.29 | Score | 85.3 |
| Open LLM Leaderboard - MATH Level 5 | 25.3 | Score | 78.3 |
| Mobile-MMLU | 64.3 | Overall Accuracy (%) | 71.4 |
| Open LLM Leaderboard - IFEval | 55.39 | Score | 66.9 |
| Open LLM Leaderboard - MMLU-Pro | 30.85 | Score | 64.1 |
| Open PL LLM - Multiple Choice | 42.98 | Average Multiple-Choice Score (%) | 57 |
| OlympicArena | 18.65 | Overall Accuracy (%) | 55.6 |
| Open PL LLM Leaderboard | 45.16 | Average Score (%) | 53.5 |
| Open PL LLM - Generative | 46.83 | Average Generative Score (%) | 47.9 |
| Open PL LLM - RAG | 51.48 | Average RAG Score (%) | 42 |
Interactive version: theaggregate.ai/model?slug=internlm2-5-7b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.