InternLM2.5-Chat-7B: benchmark results
Shanghai AI Lab's InternLM2.5 7B chat model, emphasizing math reasoning and agentic tool use, with a 1M-context sibling variant (July 2024). Provider: Shanghai AI Lab. Released 2024-07-03. Access: Open.
Unified ELO 1494 ± 16, rank #1294 of 2928 rated models, from 206 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard - BBH | 70.73 | Score | 99.3 |
| OpenCompass Language - NLP - Chinese (CompassBench 2407) | 57.5 | Score (%) | 88.2 |
| Open LLM Leaderboard - MuSR | 45.94 | Score | 87.3 |
| Open LLM Leaderboard - GPQA | 34.73 | Score | 87 |
| Open PL LLM - PSC (multiple choice, 5-shot) | 87.42 | Binary F1 (%) | 86.8 |
| Open LLM Leaderboard - MATH Level 5 | 25.3 | Score | 78.2 |
| SuperCLUE-DSPSafeBench - Overall | 77.64 | Score | 77.3 |
| OpenCompass Language - NLP - Chinese (CompassBench 2409) | 52.3 | Score (%) | 75.9 |
| OpenCompass LLM - Language - Chinese (CompassBench 2407) | 50.5 | Score (%) | 73.5 |
| Mobile-MMLU | 64.3 | Overall Accuracy (%) | 71.4 |
| Open PL LLM - PSC (generative, 5-shot) | 95.15 | Binary F1 (%) | 71.2 |
| OpenCompass Language - Dialogue - Chinese (CompassBench 2407) | 52.4 | Score (%) | 70.6 |
Interactive version: theaggregate.ai/model?slug=internlm2-5-chat-7b · How It Works · Data refreshed daily, snapshot 2026-09-23.