Configurable-Yi-1.5-9B-Chat — benchmark results
vicgalle's Configurable Safety Tuning fine-tune of Yi 1.5 9B Chat, letting system prompts set safety behavior (arXiv:2404.00495). Provider: Other. Released 2024-05-12. Access: Open.
Unified ELO 1475 ± 15, rank #889 of 1776 rated models, from 21 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| Open CoT - LogiQA | 7.99 | CoT Gain (%) | 88.9 |
| Open Chinese LLM - GSM8K | 62.32 | Accuracy (%) | 87.2 |
| Open Korean LLM Leaderboard | 485.52 | Average Score (%) | 85.9 |
| Open CoT - LogiQA 2 | 13.74 | CoT Gain (%) | 85.5 |
| Open LLM Leaderboard - GPQA | 12.42 | Score | 85.4 |
| Open Chinese LLM Leaderboard | 64.55 | Average Score (%) | 80.1 |
| Open CoT Leaderboard | 11.47 | Average CoT Gain (%) | 77.1 |
| Open Chinese LLM - ARC Challenge | 57.76 | Accuracy (%) | 76.6 |
| Open Chinese LLM - C-Eval Semantic | 84.47 | Accuracy (%) | 75.7 |
| Open Chinese LLM - TruthfulQA MC | 58.16 | Accuracy (%) | 75.4 |
| Open LLM Leaderboard - MMLU-Pro | 33.5 | Score | 74 |
| Open CoT - LSAT Logical Reasoning | 15.29 | CoT Gain (%) | 73.3 |
Interactive version: theaggregate.ai/model?slug=configurable-yi-1-5-9b-chat · How the rankings work · Data refreshed daily, snapshot 2026-07-22.