BALSAM - Entailment: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 29 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)100
2GPT-5.287.75
3Llama 4 Maverick Instruct86.92
4GLM-5 (Thinking)83
5Yehia-7B-preview79.67
6AceGPT-v2-8B-Chat78.83
7GLM-4.7 (Reasoning)78.42
8Llama 3.3 70B Instruct77.75
9Qwen 3 235B A22B77.08
10MiniMax M3 (Reasoning)76.92
11ALLaM-7B-Instruct-preview75.75
12Claude Opus 4.575.58
13GLM-5.275.17
14Jais-2-70B-Chat73.17
15Fanar-C-2-27B71.17

Interactive version: theaggregate.ai/benchmark?slug=balsam-entailment · How It Works · Data refreshed daily, snapshot 2026-09-19.