TransClean Generation - Prompt 1 - Wrong Language: leaderboard

Metric: Wrong-language Rate (%). Source: arxiv.org. Saturation forecast: Estimated already saturated. 11 models tracked.

Top models

#ModelScore
1Qwen 3 30B A3B 2507 (Thinking)0.51
2Qwen 3 30B A3B 2507 Instruct0.64
3Qwen 3 4B 2507 Instruct0.7
4Qwen 3 4B 2507 (Thinking)0.75
5DeepSeek R1 Distill Qwen 32B5.18
6Qwen 2.5 32B Instruct8.08
7aya-expanse-32B12.47
8Llama 3.2 3B Instruct15.87
9Gemma 3 27B (IT)31.82

Interactive version: theaggregate.ai/benchmark?slug=transclean-generation-prompt-1-wrong-language · How It Works · Data refreshed daily, snapshot 2026-09-24.