Configurable-Yi-1.5-9B-Chat — benchmark results

vicgalle's Configurable Safety Tuning fine-tune of Yi 1.5 9B Chat, letting system prompts set safety behavior (arXiv:2404.00495). Provider: Other. Released 2024-05-12. Access: Open.

Unified ELO 1475 ± 15, rank #889 of 1776 rated models, from 21 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
Open CoT - LogiQA7.99CoT Gain (%)88.9
Open Chinese LLM - GSM8K62.32Accuracy (%)87.2
Open Korean LLM Leaderboard485.52Average Score (%)85.9
Open CoT - LogiQA 213.74CoT Gain (%)85.5
Open LLM Leaderboard - GPQA12.42Score85.4
Open Chinese LLM Leaderboard64.55Average Score (%)80.1
Open CoT Leaderboard11.47Average CoT Gain (%)77.1
Open Chinese LLM - ARC Challenge57.76Accuracy (%)76.6
Open Chinese LLM - C-Eval Semantic84.47Accuracy (%)75.7
Open Chinese LLM - TruthfulQA MC58.16Accuracy (%)75.4
Open LLM Leaderboard - MMLU-Pro33.5Score74
Open CoT - LSAT Logical Reasoning15.29CoT Gain (%)73.3

Interactive version: theaggregate.ai/model?slug=configurable-yi-1-5-9b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.