Rombos-LLM-V2.6-Qwen-14B — benchmark results

rombodawg's continuous-finetune of Qwen2.5 14B Instruct, an incremental V2.6 update in his Rombos-LLM series. Provider: Other. Released 2024-10-12. Access: Open.

Unified ELO 1520 ± 14, rank #723 of 1776 rated models, from 130 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval84.32Score99.7
Open LLM Leaderboard - MATH Level 552.11Score97.8
Open Korean LLM Leaderboard768.15Average Score (%)97.4
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task94.67Accuracy (%)96.9
Open Arabic LLM - Aratrust Unfairness94.55Accuracy (%)91
Open Arabic LLM - Aratrust Privacy96.49Accuracy (%)90.4
Open LLM Leaderboard - BBH49.28Score90.2
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Xglue Mlqa Task92Accuracy (%)88.9
Open LLM Leaderboard - MMLU-Pro44.01Score87.4
Open Arabic LLM - Arabic MMLU Geography (Middle School)72.79Accuracy (%)86.7
Open Arabic LLM - Arabic MMLU HT Moral Scenarios51.62Accuracy (%)85.5
Open Arabic LLM - Arabic MMLU HT Machine Learning49.11Accuracy (%)84.6

Interactive version: theaggregate.ai/model?slug=rombos-llm-v2-6-qwen-14b · How the rankings work · Data refreshed daily, snapshot 2026-07-22.