BALSAM - Sequence Tagging: leaderboard

Metric: Overall score (0-100, LLM-judged generation and multiple choice). Source: benchmarks.ksaa.gov.sa. 28 models tracked.

Top models

#ModelScore
1Gemma 4 31B (IT)49.14
2GLM-4.7 (Reasoning)46.49
3GLM-5 (Thinking)45.82
4GPT-5.244.5
5Grok 4.1 Fast (Reasoning)40.83
6Claude Opus 4.540.83
7DeepSeek V3.240.2
8MiniMax M3 (Reasoning)40.04
9AceGPT-v2-8B-Chat38.42
10Fanar-C-2-27B37.11
11Kimi K2 Instruct (0905)36.75
12Command-R+36.43
13Command A 03 202536.13
14c4ai-aya-expanse-32B35.29
15Qwen 3 235B A22B35.08

Interactive version: theaggregate.ai/benchmark?slug=balsam-sequence-tagging · How It Works · Data refreshed daily, snapshot 2026-09-19.