Arcee-Spark — benchmark results

Arcee AI's 7B Qwen2-based model fine-tuned on 1.8M samples, merged with Qwen2-7B-Instruct, then refined with DPO. Provider: Arcee AI. Released 2024-06-22. Access: Open.

Unified ELO 1501 ± 10, rank #795 of 1776 rated models, from 130 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task79.9Accuracy (%)82.1
Open Arabic LLM - Aratrust Unfairness92.73Accuracy (%)82
Open LLM Leaderboard - MATH Level 529.53Score81.6
Open Arabic LLM - Arabic MMLU HT High School Mathematics40.74Accuracy (%)80.6
Open Arabic LLM - Alghafa Multiple Choice Sentiment Task41.45Accuracy (%)80.2
Open Arabic LLM - Arabic MMLU Economics (Middle School)79.31Accuracy (%)79.6
Open LLM Leaderboard - BBH37.14Score76.7
Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment Task53.96Accuracy (%)73.8
Open Arabic LLM - Arabic MMLU HT Elementary Mathematics53.7Accuracy (%)73.8
Open Arabic LLM - Arabic MMLU HT College Mathematics38Accuracy (%)72.5
Open Arabic LLM - Arabic MMLU Arabic Language (Grammar)43.01Accuracy (%)71.9
Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Xglue Mlqa Task88.67Accuracy (%)71.6

Interactive version: theaggregate.ai/model?slug=arcee-spark · How the rankings work · Data refreshed daily, snapshot 2026-07-22.