Darkest-muse-v1: benchmark results

sam-paech's creative-writing merge of two Gemma 2 9B fine-tunes (Quill and Delirium) DPO-trained on Gutenberg fiction extracts. Provider: Other. Released 2024-10-22. Access: Open.

Unified ELO 1514 ± 1, rank #629 of 1392 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval73.44Score87.9
Open LLM Leaderboard - GPQA12.53Score85.8
Open LLM Leaderboard - MuSR15.28Score82.3
Open LLM Leaderboard - BBH42.61Score81.7
Open LLM Leaderboard - MMLU-Pro35.38Score76.1
Open LLM Leaderboard - MATH Level 521.45Score73.5
Creative Writing v31185.3Elo score (self-reported)29.1
EQ-Bench Creative Writing v31027.2Elo27.9
UGI - Writing20.03Writing Score13.4
UGI - Natural Intelligence13.17NatInt Score11.9
UGI - Willingness (W/10)1.5W/10 Score5.6
UGI Leaderboard11.42UGI Score3.2

Interactive version: theaggregate.ai/model?slug=darkest-muse-v1 · How It Works · Data refreshed daily, snapshot 2026-09-05.