sarashina2-7B: benchmark results

Provider: Other. Access: Open.

Unified ELO 1439 ± 45, rank #1595 of 2656 rated models, from 26 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
pfgen-bench - Completion Mode - Score0.65pfgen Score (mean of three)82.1
pfgen-bench - Completion Mode - Truthfulness0.87Truthfulness Score82.1
pfgen-bench - Completion Mode - Helpfulness0.32Helpfulness Score81.5
pfgen-bench - Completion Mode - Fluency0.75Fluency Score80.4
Swallow - Pre-trained Japanese - NIILC63.4Character F1 (%)77.6
Swallow - Pre-trained Japanese - WMT20 En-Ja27.3BLEU67.3
Swallow - Pre-trained English - XWINO89.2Accuracy (%)57.1
Swallow - Pre-trained Japanese - JEMHopQA50.9Character F1 (%)54.1
Swallow - Pre-trained Japanese - WMT20 Ja-En20.1BLEU49
Swallow - Pre-trained English - OpenBookQA34.6Accuracy (%)43.9
Swallow - Pre-trained Japanese - JSQuAD86.8Character F1 (%)40.8
Swallow - Pre-trained Japanese - Average39.5Average Score (%)38.8

Interactive version: theaggregate.ai/model?slug=sarashina2-7b · How It Works · Data refreshed daily, snapshot 2026-09-19.