openbuddy-zero-56B-v21.2-32k — benchmark results

OpenBuddy's 56B multilingual chatbot built from Yi-34B-32K and Llama 3 70B Instruct weights, further trained with 32k context. Provider: Other. Released 2024-06-10. Access: Open.

Unified ELO 1474 ± 13, rank #891 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - C-Eval Semantic88.23Accuracy (%)87.8
Open LLM Leaderboard - BBH44.8Score85.1
Open Chinese LLM - HellaSwag67.78Accuracy (%)84.4
Open Chinese LLM Leaderboard66.04Average Score (%)82.2
Open LLM Leaderboard - MMLU-Pro37.77Score81.2
Open Chinese LLM - ARC Challenge58.53Accuracy (%)80.7
Open Chinese LLM - CMMLU68.34Accuracy (%)80.4
Open Chinese LLM - WinoGrande66.85Accuracy (%)80.4
Open Chinese LLM - TruthfulQA MC58.07Accuracy (%)74.8
Open Chinese LLM - GSM8K54.51Accuracy (%)74.6
Open LLM Leaderboard - GPQA9.06Score73.8
Open LLM Leaderboard - MuSR12.78Score70

Interactive version: theaggregate.ai/model?slug=openbuddy-zero-56b-v21-2-32k · How the rankings work · Data refreshed daily, snapshot 2026-07-22.