Qwen Turbo (2024-11-01): benchmark results
Provider: Alibaba. Released 2024-09-19. Access: API.
Unified ELO 1498 ± 44, rank #1118 of 2656 rated models, from 21 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Portuguese LLM - OAB Exams | 60.91 | Accuracy (%) | 93.1 |
| Open Portuguese LLM - BLUEX | 70.79 | Accuracy (%) | 92.3 |
| Open Portuguese LLM - ENEM | 77.96 | Accuracy (%) | 91.7 |
| Open Portuguese LLM - FaQuAD NLI | 81.28 | Macro F1 (%) | 91.7 |
| Open Portuguese LLM - ASSIN2 RTE | 92.6 | Macro F1 (%) | 80.9 |
| MATH Level 5 | 56.23 | Accuracy (%) | 48.6 |
| Open Portuguese LLM - ASSIN2 STS | 76.4 | Pearson Correlation (×100) | 29.3 |
| Open Portuguese LLM - Hate Speech | 72.39 | F1 (%) | 29.3 |
| Open Portuguese LLM - HateBR Offensive | 85.68 | F1 (%) | 22 |
| Open Portuguese LLM - TweetSentBR | 70.38 | F1 (%) | 19.5 |
| Epoch AI - GPQA Diamond | 41.79 | Accuracy (%) | 16.3 |
| Open Portuguese LLM Leaderboard | 76.49 | Average Score (%) | 12.2 |
Interactive version: theaggregate.ai/model?slug=qwen-turbo-2024-11-01 · How It Works · Data refreshed daily, snapshot 2026-09-19.