Jais-2-8B-Chat: benchmark results

Provider: Other. Access: Open.

Unified ELO 1546 ± 50, rank #851 of 2656 rated models, from 27 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
QIMMA - ArabicMMLU73.96Accuracy (%, log-likelihood multiple choice)93.9
QIMMA - PALMX78.98Accuracy (%, log-likelihood multiple choice)92.7
QIMMA - MizanQA61.33Normalized multiple-choice probability score (%)86.6
QIMMA - AraTrust87.55Accuracy (%, log-likelihood multiple choice)84.8
QIMMA - ArabCulture68.99Accuracy (%, log-likelihood multiple choice)84.1
QIMMA - Overall59.33Mean score across 14 benchmarks (%)78
QIMMA - MedAraBench41.25Accuracy (%, log-likelihood multiple choice)72
QIMMA - AraDiCE-Culture65.56Accuracy (%, log-likelihood multiple choice)69.5
QIMMA - FannOrFlop51.94F1 (%)69.5
QIMMA - MedArabiQ QA52.6BERTScore F1 (%)68.3
QIMMA - 3LM STEM79.46Accuracy (%, log-likelihood multiple choice)63.4
QIMMA - ArabLegalQA69.75BERTScore F1 (%)61

Interactive version: theaggregate.ai/model?slug=jais-2-8b-chat · How It Works · Data refreshed daily, snapshot 2026-09-19.