YOMI-Bench - Kanji Reading Prediction (Multiple Readings): leaderboard

Metric: Accuracy (%; exact match of the generated reading of a word, extracted by regular expression, averaged within each kanji group; 120 items on kanji with several readings; mean over five paraphrased prompts; accuracy as a fraction x100). Source: arxiv.org. Saturation forecast: Estimated already saturated. 10 models tracked.

Top models

#ModelScore
1GPT-596.78
2Claude Sonnet 4.592.16
3Gemini 2.5 Flash86.31
4GPT-4o69.43
5Mistral Medium 3.154.1
6Llama-3.1-Swallow-8B-Instruct-v0.551.16
7Ministral-8B-Instruct-241030.23

Interactive version: theaggregate.ai/benchmark?slug=yomi-bench-kanji-reading-prediction-multiple-readings · How It Works · Data refreshed daily, snapshot 2026-09-29.