SILMA-Kashif-2B-Instruct-v1.0 — benchmark results

SILMA AI's Gemma-based 2B Arabic/English model (January 2025) specialized for RAG question answering, with 12K context. Provider: SILMA AI. Released 2025-01-26. Access: Open.

Unified ELO 1413 ± 13, rank #1165 of 1776 rated models, from 130 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Arabic LLM - Arabic MMLU LAW (Professional)67.83Accuracy (%)59.9
Open Arabic LLM - Aratrust Ethics70Accuracy (%)57.1
Open Arabic LLM - Aratrust Privacy91.23Accuracy (%)55.9
Open Arabic LLM - Arabic MMLU HT Virology43.37Accuracy (%)53.4
Open Arabic LLM - Aratrust MentalHealth89.47Accuracy (%)51.9
Open Arabic LLM - Arabic MMLU General Knowledge (Middle School)59.88Accuracy (%)46
Open Arabic LLM - Alghafa Multiple Choice Facts Truefalse Balanced Task78.67Accuracy (%)44.4
Open Arabic LLM - Arabic MMLU HT High School Physics31.79Accuracy (%)44.1
Open Arabic LLM - Aratrust Offensive73.91Accuracy (%)43.8
Open Arabic LLM - Arabic MMLU Philosophy (High School)51.28Accuracy (%)43.5
Open Arabic LLM - Arabic MMLU General Knowledge (Primary School)57.41Accuracy (%)42.9
Open Arabic LLM - Aratrust PhysicalHealth75.34Accuracy (%)42.9

Interactive version: theaggregate.ai/model?slug=silma-kashif-2b-instruct-v1-0 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.