Qwen2.5-32B-Instruct-CFT — benchmark results

TIGER-Lab's critique-fine-tuned Qwen2.5 32B research checkpoint, trained to critique responses using only 4K GPT-4o examples. Provider: Alibaba. Released 2025-01-30. Access: Open.

Unified ELO 1578 ± 14, rank #536 of 1776 rated models, from 173 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Arabic LLM - Arabic MMLU Computer Science (University)82.81Accuracy (%)99.7
Open Arabic LLM - Aratrust MentalHealth96.05Accuracy (%)97.2
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task94.67Accuracy (%)96.9
Open Arabic LLM - Arabic MMLU HT Moral Scenarios57.54Accuracy (%)96.9
Open Japanese LLM - MR94.4Score (%)96.8
Open Japanese LLM - Jsick Exact Match85.87Score (%)96.2
Open Arabic LLM - Aratrust Ethics81.67Accuracy (%)95.7
Open Japanese LLM - Jnli Exact Match89.69Score (%)95.1
Open Japanese LLM - Wiki PAS SET F111.15Score (%)93.5
Open Arabic LLM - Arabic MMLU HT Formal Logic59.52Accuracy (%)92.9
Open Japanese LLM - NLI81.09Score (%)92.4
Open Arabic LLM - Arabic MMLU HT International LAW80.17Accuracy (%)92.3

Interactive version: theaggregate.ai/model?slug=qwen2-5-32b-instruct-cft · How the rankings work · Data refreshed daily, snapshot 2026-07-22.