openbuddy-llama3-70B-v21.2-32k — benchmark results

OpenBuddy's multilingual chatbot fine-tune of Llama 3 70B Instruct with a 32k context, aimed at English and Chinese use. Provider: Other. Released 2024-06-12. Access: Open.

Unified ELO 1509 ± 22, rank #768 of 1776 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Chinese LLM - CMMLU71.61Accuracy (%)92.4
Open LLM Leaderboard - BBH49.97Score91.6
Open Chinese LLM - GSM8K67.63Accuracy (%)91.5
Open LLM Leaderboard - MuSR18.05Score90
Open Chinese LLM Leaderboard67.4Average Score (%)88.1
Open LLM Leaderboard - MMLU-Pro42.58Score86.7
Open Chinese LLM - C-Eval Semantic87.87Accuracy (%)86.6
Open LLM Leaderboard - GPQA12.3Score85.1
Open LLM Leaderboard - IFEval70.1Score83.1
Open Chinese LLM - HellaSwag66.73Accuracy (%)81.6
Open Chinese LLM - ARC Challenge57.68Accuracy (%)76
Open Chinese LLM - WinoGrande65.98Accuracy (%)75.7

Interactive version: theaggregate.ai/model?slug=openbuddy-llama3-70b-v21-2-32k · How the rankings work · Data refreshed daily, snapshot 2026-07-22.