TransClean Generation - Prompt 0 - Wrong Language: leaderboard

Metric: Wrong-language Rate (%). Source: arxiv.org. Saturation forecast: Estimated already saturated. 12 models tracked.

Top models

#ModelScore
1Qwen 3 30B A3B 2507 (Thinking)0.65
2Qwen 3 4B 2507 (Thinking)0.99
3Qwen 3 30B A3B 2507 Instruct1.18
4Qwen 3 4B 2507 Instruct1.77
5aya-expanse-32B4.93
6DeepSeek R1 Distill Qwen 32B11.92
7Qwen 2.5 32B Instruct15.22
8Llama 3.2 3B Instruct21.67
9Gemma 3 27B (IT)31.82

Interactive version: theaggregate.ai/benchmark?slug=transclean-generation-prompt-0-wrong-language · How It Works · Data refreshed daily, snapshot 2026-09-24.