internlm2-chat-7B-ExPO — benchmark results

chujiezheng's ExPO variant of internlm2-chat-7b (2024), extrapolating between SFT and RLHF weights (alpha=0.5) to boost alignment without extra training. Provider: Shanghai AI Lab. Released 2024-05-02. Access: Open.

Unified ELO 1404 ± 5, rank #1207 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - HellaSwag62.81Accuracy (%)69.6
Open Chinese LLM - ARC Challenge53.24Accuracy (%)54.6
AlpacaEval 2.022.67LC Win Rate (%)54.1
Open Chinese LLM - TruthfulQA MC53.96Accuracy (%)53.6
Open Chinese LLM - WinoGrande62.98Accuracy (%)51.2
Open Chinese LLM - CMMLU53.44Accuracy (%)50.1
Open Chinese LLM Leaderboard56.22Average Score (%)44.5
Open Chinese LLM - C-Eval Semantic67.38Accuracy (%)43
Open Chinese LLM - GSM8K39.73Accuracy (%)38.9

Interactive version: theaggregate.ai/model?slug=internlm2-chat-7b-expo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.