Hebrew LLM - Summarization (Pairwise): leaderboard

Metric: Pairwise Score (%). Source: huggingface.co. 34 models tracked.

Top models

#ModelScore
1GPT-5.165.98
2GLM-5.3 Flash60.52
3MiniMax-M2.756.51
4GPT-5 Mini55.11
5Claude Sonnet 4.555.07
6NVIDIA-Nemotron-3-Super-120B-A12B-BF1652.81
7Gemini 3 Pro (Preview)51.76
8Gemini 3 Flash (Preview)49.75
9Gemini 2.5 Pro49.1
10MiniMax-M2.548.8
11Gemma 4 31B (IT)48.5
12GLM-5.147.9
13Qwen 3.5 397B A17B47.34
14Gemini 2.5 Flash46.94
15Qwen 3.5 122B A10B46.19

Interactive version: theaggregate.ai/benchmark?slug=hebrew-llm-summarization-pairwise · How It Works · Data refreshed daily, snapshot 2026-09-05.