Jais-2-70B-Chat: benchmark results

Provider: Other. Released 2025-12-09. Access: Open.

Unified ELO 1692 ± 36, rank #348 of 2656 rated models, from 43 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
QIMMA - ArabCulture83.24Accuracy (%, log-likelihood multiple choice)100
QIMMA - ArabicMMLU81.29Accuracy (%, log-likelihood multiple choice)100
QIMMA - AraTrust90.23Accuracy (%, log-likelihood multiple choice)98.8
QIMMA - MizanQA71.78Normalized multiple-choice probability score (%)98.8
QIMMA - PALMX83.73Accuracy (%, log-likelihood multiple choice)98.8
QIMMA - AraDiCE-Culture78.89Accuracy (%, log-likelihood multiple choice)97
QIMMA - MedAraBench50.89Accuracy (%, log-likelihood multiple choice)95.1
QIMMA - Overall67.77Mean score across 14 benchmarks (%)95.1
QIMMA - MedArabiQ QA54.67BERTScore F1 (%)93.9
QIMMA - 3LM STEM87.96Accuracy (%, log-likelihood multiple choice)89
QIMMA - MedArabiQ MCQ50.91Accuracy (%, log-likelihood multiple choice)89
QIMMA - GAT51.67Accuracy (%, log-likelihood multiple choice)84.1

Interactive version: theaggregate.ai/model?slug=jais-2-70b-chat · How It Works · Data refreshed daily, snapshot 2026-09-19.