Bielik-11B-v2.5-Instruct: benchmark results
Provider: SpeakLeash. Released 2025-05-01. Access: Open.
Unified ELO 1610 ± 21, rank #589 of 2656 rated models, from 56 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open PL LLM - 8TAGS (multiple choice, 5-shot) | 79.39 | Accuracy (%) | 92.8 |
| Open PL LLM - 8TAGS (generative, 5-shot) | 78.41 | Accuracy (%) | 91.4 |
| Open PL LLM - PolQA Closed Book (generative, 5-shot) | 82.97 | Levenshtein Similarity (%) | 90.1 |
| Open PL LLM - CBD (multiple choice, 5-shot) | 37.17 | Macro F1 (%) | 89.5 |
| Polish EQ-Bench | 72.42 | EQ-Bench Score | 89.1 |
| Open PL LLM - PolQA Open Book (generative, 5-shot) | 90.5 | Levenshtein Similarity (%) | 87.7 |
| Open PL LLM - PPC (multiple choice, 5-shot) | 79.1 | Accuracy (%) | 87.5 |
| Open PL LLM - Generative | 67.44 | Average Generative Score (%) | 87.1 |
| Open PL LLM - PoQuAD Open Book (generative, 5-shot) | 70.66 | Levenshtein Similarity (%) | 86.9 |
| Open PL LLM - PolEmo2-OUT (multiple choice, 5-shot) | 77.53 | Accuracy (%) | 86.7 |
| Polish Legal RAG - Source Classification | 96.12 | Classification score (0-100) | 86.1 |
| Open PL LLM - CBD (generative, 5-shot) | 36.12 | Macro F1 (%) | 85.8 |
Interactive version: theaggregate.ai/model?slug=bielik-11b-v2-5-instruct · How It Works · Data refreshed daily, snapshot 2026-09-19.