internlm2-chat-7B — benchmark results
Shanghai AI Lab's 7B InternLM2 chat model (January 2024) with 200K context. Provider: Shanghai AI Lab. Released 2024-01-10. Access: Open.
Unified ELO 1445 ± 18, rank #1023 of 1776 rated models, from 25 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| SALAD-Bench Base | 97.7 | Safety Score (%) | 93.9 |
| Open CoT - LSAT Reading Comprehension | 21.56 | CoT Gain (%) | 91.6 |
| Open Chinese LLM - WinoGrande | 67.4 | Accuracy (%) | 82.5 |
| Open CoT - LSAT Logical Reasoning | 17.45 | CoT Gain (%) | 81.7 |
| Open CoT Leaderboard | 11.89 | Average CoT Gain (%) | 79.4 |
| Open CoT - LSAT Analytical Reasoning | 6.09 | CoT Gain (%) | 76.7 |
| SALAD-Bench | 58.99 | Average Safety Score (%) | 75.8 |
| Open Chinese LLM - HellaSwag | 63.02 | Accuracy (%) | 71.5 |
| Open Chinese LLM Leaderboard | 60.49 | Average Score (%) | 71.5 |
| Open CoT - LogiQA 2 | 10.18 | CoT Gain (%) | 71 |
| Open Chinese LLM - GSM8K | 50.57 | Accuracy (%) | 68.8 |
| Open Chinese LLM - C-Eval Semantic | 79.44 | Accuracy (%) | 68.5 |
Interactive version: theaggregate.ai/model?slug=internlm2-chat-7b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.