stablelm-base-alpha-3B: benchmark results

Provider: Stability AI. Access: Open.

Unified ELO 960 ± 66, rank #2654 of 2656 rated models, from 15 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ToolBench - WebShop Long0Task Score44.2
ToolBench - WebShop Short0Task Score24.4
Open Portuguese LLM - FaQuAD NLI43.97Macro F1 (%)17.1
Open Portuguese LLM - ENEM20.99Accuracy (%)16.1
Open Portuguese LLM - OAB Exams24.56Accuracy (%)13.5
ToolBench - VirtualHome5.3Task Score9.3
Open Portuguese LLM - BLUEX19.47Accuracy (%)8.7
ToolBench - Tabletop1Task Score8.1
ToolBench - Google Sheets1.4Task Score5.8
ToolBench - Home Search0Task Score5.8
Open Portuguese LLM - ASSIN2 RTE33.33Macro F1 (%)4.9
ToolBench - Trip Booking0Task Score4.7

Interactive version: theaggregate.ai/model?slug=stablelm-base-alpha-3b · How It Works · Data refreshed daily, snapshot 2026-09-19.