sarashina2-13B: benchmark results
Provider: Other. Access: Open.
Unified ELO 1485 ± 45, rank #1218 of 2656 rated models, from 26 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Swallow - Pre-trained Japanese - NIILC | 66.1 | Character F1 (%) | 89.8 |
| pfgen-bench - Completion Mode - Helpfulness | 0.39 | Helpfulness Score | 88.8 |
| pfgen-bench - Completion Mode - Truthfulness | 0.9 | Truthfulness Score | 87.9 |
| pfgen-bench - Completion Mode - Score | 0.69 | pfgen Score (mean of three) | 87.2 |
| pfgen-bench - Completion Mode - Fluency | 0.79 | Fluency Score | 86.3 |
| Swallow - Pre-trained Japanese - WMT20 En-Ja | 28.4 | BLEU | 73.5 |
| Swallow - Pre-trained Japanese - JEMHopQA | 55.7 | Character F1 (%) | 67.3 |
| Swallow - Pre-trained Japanese - WMT20 Ja-En | 22.1 | BLEU | 65.3 |
| Swallow - Pre-trained English - XWINO | 89.6 | Accuracy (%) | 61.2 |
| Swallow - Pre-trained Japanese - JSQuAD | 89.8 | Character F1 (%) | 56.1 |
| Swallow - Pre-trained Japanese - Average | 44.5 | Average Score (%) | 53.1 |
| Swallow - Pre-trained Japanese - JCommonsenseQA | 85 | Accuracy (%) | 53.1 |
Interactive version: theaggregate.ai/model?slug=sarashina2-13b · How It Works · Data refreshed daily, snapshot 2026-09-19.