Phind-CodeLlama-34B-v1: benchmark results
Provider: Other. Access: Open.
Unified ELO 1352 ± 30, rank #2470 of 2928 rated models, from 10 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| InfiBench | 58.47 | Score (%) | 93.3 |
| EffiBench - NMU | 1.9 | Normalized Memory Usage | 79.3 |
| BigCode Models Leaderboard | 65.8 | HumanEval Python Pass@1 (%) | 78 |
| EffiBench - NET | 2.91 | Normalized Execution Time | 67.1 |
| Open LLM Leaderboard v1 - GSM8K | 20.47 | Accuracy (%) (5-shot) | 41.3 |
| Open LLM Leaderboard v1 - WinoGrande | 72.61 | Accuracy (%) (5-shot) | 29.5 |
| Open LLM Leaderboard v1 - TruthfulQA MC2 | 44.94 | MC2 (%) (0-shot) | 29.1 |
| Open LLM Leaderboard v1 - MMLU | 28.94 | Accuracy (%) (5-shot) | 16.2 |
| Open LLM Leaderboard v1 - ARC Challenge | 27.13 | Normalized accuracy (%) (25-shot) | 6.3 |
| Open LLM Leaderboard v1 - HellaSwag | 28.28 | Normalized accuracy (%) (10-shot) | 4.7 |
Interactive version: theaggregate.ai/model?slug=phind-codellama-34b-v1 · How It Works · Data refreshed daily, snapshot 2026-09-23.