Qwen3.8 2.4T A95B: benchmark results
Provider: Alibaba. Released 2026-08-13. Access: Open.
Unified ELO 1719 ± 1, rank #32 of 1392 rated models, from 80 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| AA Omniscience - Software Engineering (SWE) - Rust | 82 | Accuracy (%) | 99.8 |
| Nejumi 4 - ALT Average | 91.71 | Score (%) | 99.2 |
| Nejumi 4 - ALT - Bias | 97.44 | Score (%) | 98.4 |
| Nejumi 4 - Total Score | 85.98 | Score (%) | 98.4 |
| Nejumi 4 - GLP - Logical Reasoning | 96.5 | Score (%) | 98 |
| Tau3 Banking | 49.07 | Success Rate (%) | 98 |
| Nejumi 4 - GLP - Reasoning | 94.11 | Score (%) | 97.5 |
| AA GPQA Diamond | 93.54 | Accuracy (%) | 97.3 |
| Nejumi 4 - SWE-Bench (Japanese) | 70 | Score (%) | 96.3 |
| BenchmarkList ECI | 149.56 | Capability Index (ECI) | 96.2 |
| AI for Education SEND | 86.24 | Accuracy (%) | 95.7 |
| Nejumi 4 - GLP - Basic Language | 86.68 | Score (%) | 95.5 |
Interactive version: theaggregate.ai/model?slug=qwen3-8-2-4t-a95b · How It Works · Data refreshed daily, snapshot 2026-09-05.