Jais-2-8B-Chat: benchmark results
Provider: Other. Access: Open.
Unified ELO 1546 ± 50, rank #851 of 2656 rated models, from 27 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| QIMMA - ArabicMMLU | 73.96 | Accuracy (%, log-likelihood multiple choice) | 93.9 |
| QIMMA - PALMX | 78.98 | Accuracy (%, log-likelihood multiple choice) | 92.7 |
| QIMMA - MizanQA | 61.33 | Normalized multiple-choice probability score (%) | 86.6 |
| QIMMA - AraTrust | 87.55 | Accuracy (%, log-likelihood multiple choice) | 84.8 |
| QIMMA - ArabCulture | 68.99 | Accuracy (%, log-likelihood multiple choice) | 84.1 |
| QIMMA - Overall | 59.33 | Mean score across 14 benchmarks (%) | 78 |
| QIMMA - MedAraBench | 41.25 | Accuracy (%, log-likelihood multiple choice) | 72 |
| QIMMA - AraDiCE-Culture | 65.56 | Accuracy (%, log-likelihood multiple choice) | 69.5 |
| QIMMA - FannOrFlop | 51.94 | F1 (%) | 69.5 |
| QIMMA - MedArabiQ QA | 52.6 | BERTScore F1 (%) | 68.3 |
| QIMMA - 3LM STEM | 79.46 | Accuracy (%, log-likelihood multiple choice) | 63.4 |
| QIMMA - ArabLegalQA | 69.75 | BERTScore F1 (%) | 61 |
Interactive version: theaggregate.ai/model?slug=jais-2-8b-chat · How It Works · Data refreshed daily, snapshot 2026-09-19.