lambda-qwen2.5-32B-dpo-test — benchmark results

tanliboy's experimental DPO fine-tune of Qwen 2.5 32B Instruct. Provider: Other. Released 2024-09-22. Access: Open.

Unified ELO 1595 ± 10, rank #485 of 1776 rated models, from 129 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Arabic LLM - Arabic MMLU Philosophy (High School)76.92Accuracy (%)100
Open LLM Leaderboard - MATH Level 561.03Score99.8
Open Arabic LLM - Arabic MMLU Computer Science (University)82.81Accuracy (%)99.7
Open LLM Leaderboard - MMLU-Pro51.74Score98.9
Open Arabic LLM - Alghafa Meta AR MSA92.07Accuracy (%)98.8
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task95.33Accuracy (%)98.8
Open LLM Leaderboard - IFEval80.84Score98.2
Open Arabic LLM - Arabic MMLU HT Moral Scenarios57.88Accuracy (%)97.5
Open LLM Leaderboard - BBH54.41Score96.5
Open Arabic LLM - Arabic MMLU Economics (High School)73.61Accuracy (%)95.1
Open Arabic LLM - Arabic MMLU HT Elementary Mathematics69.84Accuracy (%)95.1
Open Arabic LLM - Arabic MMLU Arabic Language (High School)46.67Accuracy (%)94.1

Interactive version: theaggregate.ai/model?slug=lambda-qwen2-5-32b-dpo-test · How the rankings work · Data refreshed daily, snapshot 2026-07-22.