Bielik-11B-v2.2-Instruct — benchmark results

SpeakLeash's Polish-focused 11B instruct fine-tune of the Bielik v2 base, a Mistral 7B v0.2 depth-upscaled to 11B (August 2024). Provider: SpeakLeash. Released 2024-08-26. Access: Open.

Unified ELO 1514 ± 17, rank #753 of 1776 rated models, from 23 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open PL LLM - RAG76.92Average RAG Score (%)100
Open PL LLM - Multiple Choice63.41Average Multiple-Choice Score (%)96.3
Open PL LLM Leaderboard65.57Average Score (%)93
MT-Bench PL - Writing9.35Judge Score (0-10)90.8
Open PL LLM - Generative67.23Average Generative Score (%)85
Open LLM Leaderboard - GPQA10.85Score81
Open LLM Leaderboard - MATH Level 526.81Score79.4
LLMZSZL Leaderboard57.36Score77.6
MT-Bench PL - Roleplay9.03Judge Score (0-10)77.6
Polish EQ-Bench69.05EQ-Bench Score77.2
Open LLM Leaderboard - BBH36.96Score76.4
MT-Bench PL - Reasoning6.9Judge Score (0-10)75.5

Interactive version: theaggregate.ai/model?slug=bielik-11b-v2-2-instruct · How the rankings work · Data refreshed daily, snapshot 2026-07-22.