Bielik-11B-v2.1-Instruct — benchmark results

SpeakLeash's Polish 11B instruct fine-tune of the Bielik v2 base (depth-upscaled Mistral 7B v0.2), sibling variant to v2.2 (August 2024). Provider: SpeakLeash. Released 2024-08-26. Access: Open.

Unified ELO 1510 ± 21, rank #765 of 1776 rated models, from 23 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open PL LLM - RAG76.79Average RAG Score (%)99.5
MT-Bench PL - Writing9.5Judge Score (0-10)94.9
MT-Bench PL - Roleplay9.45Judge Score (0-10)93.9
Open PL LLM - Multiple Choice62.88Average Multiple-Choice Score (%)92.3
Open PL LLM Leaderboard65.45Average Score (%)92
Open PL LLM - Generative67.42Average Generative Score (%)86.7
Open LLM Leaderboard - GPQA11.63Score83.4
LLMZSZL Leaderboard57.52Score79.6
Open LLM Leaderboard - MATH Level 526.66Score79.3
Open LLM Leaderboard - BBH36.29Score74.4
Polish EQ-Bench66.27EQ-Bench Score72.3
MT-Bench PL - Reasoning6.25Judge Score (0-10)66.3

Interactive version: theaggregate.ai/model?slug=bielik-11b-v2-1-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.