llm-jp-13B-instruct-full-jaster-dolly-oasst-v1.0: benchmark results

Provider: Other. Access: Open.

Unified ELO 1195 ± 20, rank #2908 of 2928 rated models, from 14 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
pfgen-bench - Completion Mode - Truthfulness0.79Truthfulness Score60.7
pfgen-bench - Completion Mode - Score0.52pfgen Score (mean of three)59.7
pfgen-bench - Completion Mode - Fluency0.61Fluency Score58.9
pfgen-bench - Completion Mode - Helpfulness0.16Helpfulness Score58
pfgen-bench - QA Mode - Truthfulness0.72Truthfulness Score43.9
Open LLM Leaderboard v1 - TruthfulQA MC245.19MC2 (%) (0-shot)30
pfgen-bench - QA Mode - Helpfulness0.06Helpfulness Score21.8
pfgen-bench - QA Mode - Score0.35pfgen Score (mean of three)19.4
Open LLM Leaderboard v1 - HellaSwag44.78Normalized accuracy (%) (10-shot)9
pfgen-bench - QA Mode - Fluency0.28Fluency Score7.9
Open LLM Leaderboard v1 - ARC Challenge26.88Normalized accuracy (%) (25-shot)6.1
Open LLM Leaderboard v1 - GSM8K0Accuracy (%) (5-shot)4.6

Interactive version: theaggregate.ai/model?slug=llm-jp-13b-instruct-full-jaster-dolly-oasst-v1-0 · How It Works · Data refreshed daily, snapshot 2026-09-23.