Bielik-11B-v2.5-Instruct: benchmark results

Provider: SpeakLeash. Released 2025-05-01. Access: Open.

Unified ELO 1610 ± 21, rank #589 of 2656 rated models, from 56 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open PL LLM - 8TAGS (multiple choice, 5-shot)79.39Accuracy (%)92.8
Open PL LLM - 8TAGS (generative, 5-shot)78.41Accuracy (%)91.4
Open PL LLM - PolQA Closed Book (generative, 5-shot)82.97Levenshtein Similarity (%)90.1
Open PL LLM - CBD (multiple choice, 5-shot)37.17Macro F1 (%)89.5
Polish EQ-Bench72.42EQ-Bench Score89.1
Open PL LLM - PolQA Open Book (generative, 5-shot)90.5Levenshtein Similarity (%)87.7
Open PL LLM - PPC (multiple choice, 5-shot)79.1Accuracy (%)87.5
Open PL LLM - Generative67.44Average Generative Score (%)87.1
Open PL LLM - PoQuAD Open Book (generative, 5-shot)70.66Levenshtein Similarity (%)86.9
Open PL LLM - PolEmo2-OUT (multiple choice, 5-shot)77.53Accuracy (%)86.7
Polish Legal RAG - Source Classification96.12Classification score (0-100)86.1
Open PL LLM - CBD (generative, 5-shot)36.12Macro F1 (%)85.8

Interactive version: theaggregate.ai/model?slug=bielik-11b-v2-5-instruct · How It Works · Data refreshed daily, snapshot 2026-09-19.