Qwen3.8 2.4T A95B: benchmark results

Provider: Alibaba. Released 2026-08-13. Access: Open.

Unified ELO 1719 ± 1, rank #32 of 1392 rated models, from 80 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
AA Omniscience - Software Engineering (SWE) - Rust82Accuracy (%)99.8
Nejumi 4 - ALT Average91.71Score (%)99.2
Nejumi 4 - ALT - Bias97.44Score (%)98.4
Nejumi 4 - Total Score85.98Score (%)98.4
Nejumi 4 - GLP - Logical Reasoning96.5Score (%)98
Tau3 Banking49.07Success Rate (%)98
Nejumi 4 - GLP - Reasoning94.11Score (%)97.5
AA GPQA Diamond93.54Accuracy (%)97.3
Nejumi 4 - SWE-Bench (Japanese)70Score (%)96.3
BenchmarkList ECI149.56Capability Index (ECI)96.2
AI for Education SEND86.24Accuracy (%)95.7
Nejumi 4 - GLP - Basic Language86.68Score (%)95.5

Interactive version: theaggregate.ai/model?slug=qwen3-8-2-4t-a95b · How It Works · Data refreshed daily, snapshot 2026-09-05.