Qwen2.5-32B-Instruct-CFT — benchmark results
TIGER-Lab's critique-fine-tuned Qwen2.5 32B research checkpoint, trained to critique responses using only 4K GPT-4o examples. Provider: Alibaba. Released 2025-01-30. Access: Open.
Unified ELO 1578 ± 14, rank #536 of 1776 rated models, from 173 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Arabic LLM - Arabic MMLU Computer Science (University) | 82.81 | Accuracy (%) | 99.7 |
| Open Arabic LLM - Aratrust MentalHealth | 96.05 | Accuracy (%) | 97.2 |
| Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task | 94.67 | Accuracy (%) | 96.9 |
| Open Arabic LLM - Arabic MMLU HT Moral Scenarios | 57.54 | Accuracy (%) | 96.9 |
| Open Japanese LLM - MR | 94.4 | Score (%) | 96.8 |
| Open Japanese LLM - Jsick Exact Match | 85.87 | Score (%) | 96.2 |
| Open Arabic LLM - Aratrust Ethics | 81.67 | Accuracy (%) | 95.7 |
| Open Japanese LLM - Jnli Exact Match | 89.69 | Score (%) | 95.1 |
| Open Japanese LLM - Wiki PAS SET F1 | 11.15 | Score (%) | 93.5 |
| Open Arabic LLM - Arabic MMLU HT Formal Logic | 59.52 | Accuracy (%) | 92.9 |
| Open Japanese LLM - NLI | 81.09 | Score (%) | 92.4 |
| Open Arabic LLM - Arabic MMLU HT International LAW | 80.17 | Accuracy (%) | 92.3 |
Interactive version: theaggregate.ai/model?slug=qwen2-5-32b-instruct-cft · How the rankings work · Data refreshed daily, snapshot 2026-07-22.