sarashina2-70B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1582 ± 45, rank #702 of 2656 rated models, from 26 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Swallow - Pre-trained Japanese - JEMHopQA71.7Character F1 (%)100
pfgen-bench - Completion Mode - Helpfulness0.49Helpfulness Score96.8
Swallow - Pre-trained English - SQuAD267.5Exact Match (%)95.9
Swallow - Pre-trained Japanese - JSQuAD92.9Character F1 (%)95.9
pfgen-bench - Completion Mode - Score0.74pfgen Score (mean of three)95.2
Swallow - Pre-trained Japanese - WMT20 En-Ja31.3BLEU94.9
pfgen-bench - Completion Mode - Truthfulness0.92Truthfulness Score94.7
pfgen-bench - Completion Mode - Fluency0.83Fluency Score93.3
Swallow - Pre-trained Japanese - NIILC66.8Character F1 (%)91.8
Swallow - Pre-trained English - XWINO91.7Accuracy (%)90.8
Swallow - Pre-trained Japanese - WMT20 Ja-En24.3BLEU81.6
Swallow - Pre-trained English - HellaSwag62.8Accuracy (%)76.5

Interactive version: theaggregate.ai/model?slug=sarashina2-70b · How It Works · Data refreshed daily, snapshot 2026-09-19.