youri-7B-chat: benchmark results

Provider: Other. Access: Open.

Unified ELO 1353 ± 21, rank #2466 of 2928 rated models, from 10 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
pfgen-bench - QA Mode - Truthfulness0.73Truthfulness Score46.7
Open LLM Leaderboard v1 - WinoGrande75.06Accuracy (%) (5-shot)40.1
pfgen-bench - QA Mode - Score0.44pfgen Score (mean of three)37
pfgen-bench - QA Mode - Fluency0.5Fluency Score32.1
pfgen-bench - QA Mode - Helpfulness0.08Helpfulness Score29.7
Open LLM Leaderboard v1 - HellaSwag76.09Normalized accuracy (%) (10-shot)28
Open LLM Leaderboard v1 - ARC Challenge51.19Normalized accuracy (%) (25-shot)25.6
Open LLM Leaderboard v1 - MMLU46.06Accuracy (%) (5-shot)24.6
Open LLM Leaderboard v1 - GSM8K1.52Accuracy (%) (5-shot)17.3
Open LLM Leaderboard v1 - TruthfulQA MC241.17MC2 (%) (0-shot)16.3

Interactive version: theaggregate.ai/model?slug=youri-7b-chat · How It Works · Data refreshed daily, snapshot 2026-09-23.