NOLLI - Direct Translations - English: leaderboard

Metric: Accuracy (%; eight translated puzzle types). Source: arxiv.org. 15 models tracked.

Top models

#ModelScore
1GPT-5.5 (Medium)83.4
2Claude Opus 4.8 (Medium)79.6
3Gemini 3.1 Pro (Preview) (Medium)75.8
4Qwen 3.5 397B A17B (Non-reasoning)68.3
5Qwen 3.5 27B58.3
6GPT-OSS-120B (Medium)56.6
7Gemma 4 31B (IT) (Thinking)56.3
8DeepSeek V4 Flash49.5
9Qwen 3.5 9B (Non-reasoning)39.8
10EXAONE-4.0-32B (Thinking)30.9
11Llama 4 Maverick20.6
12Solar Open 100B14.7
13Llama 3.1 8B Instruct2.3

Interactive version: theaggregate.ai/benchmark?slug=nolli-direct-translations-english · How It Works · Data refreshed daily, snapshot 2026-09-19.