internlm2-chat-20B-ExPO — benchmark results

Community ExPO variant of InternLM2-chat-20B (2024) extrapolating SFT and RLHF weights for stronger alignment without extra training. Provider: Shanghai AI Lab. Released 2024-05-02. Access: Open.

Unified ELO 1438 ± 11, rank #1055 of 1776 rated models, from 9 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - ARC Challenge59.47Accuracy (%)84.7
Open Chinese LLM - HellaSwag65.95Accuracy (%)80.1
Open Chinese LLM - WinoGrande66.22Accuracy (%)77
Open Chinese LLM Leaderboard61.26Average Score (%)72.7
Open Chinese LLM - C-Eval Semantic81.42Accuracy (%)70.3
Open Chinese LLM - CMMLU59.05Accuracy (%)67.1
AlpacaEval 2.027.23LC Win Rate (%)64
Open Chinese LLM - GSM8K45.64Accuracy (%)49.6
Open Chinese LLM - TruthfulQA MC51.07Accuracy (%)25.1

Interactive version: theaggregate.ai/model?slug=internlm2-chat-20b-expo · How the rankings work · Data refreshed daily, snapshot 2026-07-22.