BgGPT-7B-Instruct-v0.2: benchmark results
Provider: Other. Access: Open.
Unified ELO 1444 ± 17, rank #1778 of 2928 rated models, from 129 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open Arabic LLM - Alghafa Multiple Choice Sentiment Task | 40.81 | Accuracy (%) | 74.1 |
| Open LLM Leaderboard v1 - TruthfulQA MC2 | 54.63 | MC2 (%) (0-shot) | 63.1 |
| Open LLM Leaderboard v1 - GSM8K | 44.12 | Accuracy (%) (5-shot) | 58.3 |
| Open LLM Leaderboard v1 - HellaSwag | 82.18 | Normalized accuracy (%) (10-shot) | 49.4 |
| Open LLM Leaderboard v1 - WinoGrande | 76.48 | Accuracy (%) (5-shot) | 48.5 |
| Open LLM Leaderboard v1 - ARC Challenge | 60.58 | Normalized accuracy (%) (25-shot) | 48.4 |
| Open LLM Leaderboard v1 - MMLU | 60.5 | Accuracy (%) (5-shot) | 48.4 |
| Open Arabic LLM - Arabic MMLU HT Econometrics | 30.7 | Accuracy (%) | 45.4 |
| Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Xglue Mlqa Task | 74 | Accuracy (%) | 44.8 |
| Open Arabic LLM - Alghafa Multiple Choice Grounded Statement Soqal Task | 75.33 | Accuracy (%) | 43.5 |
| Open Arabic LLM - Arabic MMLU HT Abstract Algebra | 27 | Accuracy (%) | 43.2 |
| Open Arabic LLM - Alghafa Multiple Choice Rating Sentiment Task | 49.87 | Accuracy (%) | 42.6 |
Interactive version: theaggregate.ai/model?slug=bggpt-7b-instruct-v0-2 · How It Works · Data refreshed daily, snapshot 2026-09-23.