34B-beta — benchmark results

CausalLM's beta 34B ChatML chat model initialized from Yi-34B, released with noted weight-precision caveats for accelerated inference. Provider: Other. Released 2024-02-06. Access: Open.

Unified ELO 1434 ± 27, rank #1073 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - CMMLU71.71Accuracy (%)93.5
Open LLM Leaderboard - MMLU-Pro48.06Score93.3
Open LLM Leaderboard - GPQA12.86Score86.7
Open Chinese LLM - C-Eval Semantic87.62Accuracy (%)85.8
Open Chinese LLM - ARC Challenge59.22Accuracy (%)82.8
Open Chinese LLM - HellaSwag66.42Accuracy (%)81.2
Open Chinese LLM Leaderboard64.5Average Score (%)79.8
Open LLM Leaderboard - BBH36.68Score75.8
Open Chinese LLM - WinoGrande65.75Accuracy (%)74.5
Open Chinese LLM - GSM8K47.99Accuracy (%)60.8
Open Chinese LLM - TruthfulQA MC52.78Accuracy (%)40.9
Open LLM Leaderboard - MuSR6.92Score32.5

Interactive version: theaggregate.ai/model?slug=34b-beta · How the rankings work · Data refreshed daily, snapshot 2026-07-22.