Arcee-Spark — benchmark results
Arcee AI's 7B Qwen2-based model fine-tuned on 1.8M samples, merged with Qwen2-7B-Instruct, then refined with DPO. Provider: Arcee AI. Released 2024-06-22. Access: Open.
Unified ELO 1501 ± 10, rank #795 of 1776 rated models, from 130 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment NO Neutral Task | 79.9 | Accuracy (%) | 82.1 |
| Open Arabic LLM - Aratrust Unfairness | 92.73 | Accuracy (%) | 82 |
| Open LLM Leaderboard - MATH Level 5 | 29.53 | Score | 81.6 |
| Open Arabic LLM - Arabic MMLU HT High School Mathematics | 40.74 | Accuracy (%) | 80.6 |
| Open Arabic LLM - Alghafa Multiple Choice Sentiment Task | 41.45 | Accuracy (%) | 80.2 |
| Open Arabic LLM - Arabic MMLU Economics (Middle School) | 79.31 | Accuracy (%) | 79.6 |
| Open LLM Leaderboard - BBH | 37.14 | Score | 76.7 |
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment Task | 53.96 | Accuracy (%) | 73.8 |
| Open Arabic LLM - Arabic MMLU HT Elementary Mathematics | 53.7 | Accuracy (%) | 73.8 |
| Open Arabic LLM - Arabic MMLU HT College Mathematics | 38 | Accuracy (%) | 72.5 |
| Open Arabic LLM - Arabic MMLU Arabic Language (Grammar) | 43.01 | Accuracy (%) | 71.9 |
| Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Xglue Mlqa Task | 88.67 | Accuracy (%) | 71.6 |
Interactive version: theaggregate.ai/model?slug=arcee-spark · How the rankings work · Data refreshed daily, snapshot 2026-07-22.