sarashina2.2-3B-instruct-v0.1: benchmark results

Provider: Other. Access: Open.

Unified ELO 1504 ± 33, rank #1066 of 2656 rated models, from 47 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
pfgen-bench - Completion Mode - Helpfulness0.52Helpfulness Score98.7
pfgen-bench - Completion Mode - Score0.75pfgen Score (mean of three)96.2
pfgen-bench - Completion Mode - Fluency0.84Fluency Score94.9
pfgen-bench - QA Mode - Fluency0.81Fluency Score89.1
pfgen-bench - QA Mode - Helpfulness0.46Helpfulness Score87.3
pfgen-bench - Completion Mode - Truthfulness0.89Truthfulness Score85.6
pfgen-bench - Chat Mode - Fluency0.72Fluency Score85.3
pfgen-bench - QA Mode - Score0.72pfgen Score (mean of three)84.8
pfgen-bench - Chat Mode - Helpfulness0.3Helpfulness Score82.4
pfgen-bench - Chat Mode - Score0.62pfgen Score (mean of three)79.4
pfgen-bench - QA Mode - Truthfulness0.88Truthfulness Score73.9
pfgen-bench - Chat Mode - Truthfulness0.83Truthfulness Score70.6

Interactive version: theaggregate.ai/model?slug=sarashina2-2-3b-instruct-v0-1 · How It Works · Data refreshed daily, snapshot 2026-09-19.