TransClean Generation - Prompt 2 - Wrong Language: leaderboard

Metric: Wrong-language Rate (%). Source: arxiv.org. Saturation forecast: Estimated already saturated. 12 models tracked.

Top models

#ModelScore
1Gemma 3 27B (IT)0.46
2Qwen 3 30B A3B 2507 (Thinking)0.52
3aya-expanse-32B0.6
4Qwen 3 30B A3B 2507 Instruct0.68
5Qwen 3 4B 2507 (Thinking)0.73
6Qwen 3 4B 2507 Instruct0.77
7DeepSeek R1 Distill Qwen 32B1.36
8Llama 3.2 3B Instruct4.03
9Qwen 2.5 32B Instruct4.1

Interactive version: theaggregate.ai/benchmark?slug=transclean-generation-prompt-2-wrong-language · How It Works · Data refreshed daily, snapshot 2026-09-24.