openbuddy-deepseek-67B-v18.1-4k: benchmark results
Provider: Other. Access: Open.
Unified ELO 1539 ± 17, rank #949 of 2928 rated models, from 14 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open LLM Leaderboard v1 - MMLU | 70.58 | Accuracy (%) (5-shot) | 94.1 |
| Open Chinese LLM - HellaSwag | 69.95 | Accuracy (%) | 93.8 |
| Open Chinese LLM - ARC Challenge | 63.48 | Accuracy (%) | 93.5 |
| Open Chinese LLM - CMMLU | 71.16 | Accuracy (%) | 91.1 |
| Open Chinese LLM Leaderboard | 67.99 | Average Score (%) | 89 |
| Open LLM Leaderboard v1 - GSM8K | 69.22 | Accuracy (%) (5-shot) | 88.4 |
| Open Chinese LLM - WinoGrande | 68.9 | Accuracy (%) | 88.3 |
| Open LLM Leaderboard v1 - WinoGrande | 82.95 | Accuracy (%) (5-shot) | 86.4 |
| Open Chinese LLM - GSM8K | 59.06 | Accuracy (%) | 82.6 |
| Open Chinese LLM - C-Eval Semantic | 86.58 | Accuracy (%) | 80.6 |
| Open LLM Leaderboard v1 - ARC Challenge | 67.75 | Normalized accuracy (%) (25-shot) | 78 |
| Open Chinese LLM - TruthfulQA MC | 56.8 | Accuracy (%) | 71.8 |
Interactive version: theaggregate.ai/model?slug=openbuddy-deepseek-67b-v18-1-4k · How It Works · Data refreshed daily, snapshot 2026-09-23.