blossom-v5.1-34B — benchmark results

Azure99's Blossom v5.1 bilingual Chinese-English chat fine-tune of Yi-1.5-34B, trained in two stages on Wizard, Orca, Math and Blossom dialogue data (May 2024). Provider: Other. Released 2024-05-19. Access: Open.

Unified ELO 1485 ± 23, rank #858 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM Leaderboard68.67Average Score (%)92.6
Open Chinese LLM - GSM8K67.85Accuracy (%)92
Open Chinese LLM - C-Eval Semantic89.73Accuracy (%)91.2
Open Chinese LLM - ARC Challenge61.18Accuracy (%)90.1
Open Chinese LLM - HellaSwag68.61Accuracy (%)88.6
Open Chinese LLM - WinoGrande68.51Accuracy (%)86.9
Open Chinese LLM - CMMLU70.37Accuracy (%)86.4
Open LLM Leaderboard - MMLU-Pro39.53Score84.6
Open LLM Leaderboard - BBH44.15Score84.1
Open LLM Leaderboard - MATH Level 525.91Score78.8
Open LLM Leaderboard - IFEval56.97Score68.9
Open LLM Leaderboard - GPQA7.94Score67

Interactive version: theaggregate.ai/model?slug=blossom-v5-1-34b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.