openbuddy-deepseek-67B-v18.1-4k: benchmark results

Provider: Other. Access: Open.

Unified ELO 1539 ± 17, rank #949 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard v1 - MMLU70.58Accuracy (%) (5-shot)94.1
Open Chinese LLM - HellaSwag69.95Accuracy (%)93.8
Open Chinese LLM - ARC Challenge63.48Accuracy (%)93.5
Open Chinese LLM - CMMLU71.16Accuracy (%)91.1
Open Chinese LLM Leaderboard67.99Average Score (%)89
Open LLM Leaderboard v1 - GSM8K69.22Accuracy (%) (5-shot)88.4
Open Chinese LLM - WinoGrande68.9Accuracy (%)88.3
Open LLM Leaderboard v1 - WinoGrande82.95Accuracy (%) (5-shot)86.4
Open Chinese LLM - GSM8K59.06Accuracy (%)82.6
Open Chinese LLM - C-Eval Semantic86.58Accuracy (%)80.6
Open LLM Leaderboard v1 - ARC Challenge67.75Normalized accuracy (%) (25-shot)78
Open Chinese LLM - TruthfulQA MC56.8Accuracy (%)71.8

Interactive version: theaggregate.ai/model?slug=openbuddy-deepseek-67b-v18-1-4k · How It Works · Data refreshed daily, snapshot 2026-09-23.