Granite 4.1 3B — benchmark results

IBM's 3B dense decoder-only model from the Apache-2.0 Granite 4.1 family (April 2026), trained on ~15T tokens with context extension up to 512K. Provider: IBM. Released 2026-04-29. Access: Open.

Unified ELO 1408 ± 22, rank #1184 of 1776 rated models, from 36 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - PHP18Accuracy (%)34.7
AA Omniscience - Software Engineering (SWE) - JavaScript24.55Accuracy (%)33.9
AA Omniscience - Software Engineering (SWE) - Dart16Accuracy (%)33.7
AA Omniscience - Software Engineering (SWE) - Kotlin12Accuracy (%)31.1
CritPt0Accuracy (self-reported)30.3
AA CritPt0Accuracy (%)27.1
AA Omniscience - Software Engineering (SWE) - Julia4Accuracy (%)23.7
AA IFBench33.67Accuracy (%)23.4
AA Omniscience - Software Engineering (SWE) - Java11Accuracy (%)22.2
AA-LCR3Score (self-reported)20
AA Terminal-Bench Hard2.27Accuracy (%)19.6
AA Omniscience - Software Engineering (SWE) - TypeScript10Accuracy (%)19

Interactive version: theaggregate.ai/model?slug=granite-4-1-3b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.