Darkest-muse-v1 — benchmark results

sam-paech's creative-writing merge of two Gemma 2 9B fine-tunes (Quill and Delirium) DPO-trained on Gutenberg fiction extracts. Provider: Other. Released 2024-10-22. Access: Open.

Unified ELO 1501 ± 29, rank #796 of 1776 rated models, from 12 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open LLM Leaderboard - IFEval73.44Score87.9
Open LLM Leaderboard - GPQA12.53Score85.8
Open LLM Leaderboard - MuSR15.28Score82.3
Open LLM Leaderboard - BBH42.61Score81.7
Open LLM Leaderboard - MMLU-Pro35.38Score76.1
Open LLM Leaderboard - MATH Level 521.45Score73.5
Creative Writing v31173Elo score (self-reported)28.7
EQ-Bench Creative Writing v31027.2Elo27.9
UGI - Writing20.03Writing Score13.6
UGI - Natural Intelligence13.17NatInt Score12.1
UGI - Willingness (W/10)1.5W/10 Score5.6
UGI Leaderboard11.42UGI Score3.2

Interactive version: theaggregate.ai/model?slug=darkest-muse-v1 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.