PIJ - Sentence Prediction: leaderboard
Metric: Score (%). Source: arxiv.org. 10 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Gemini 3 Flash | 65.87 |
| 2 | GPT-5.4 | 57.73 |
| 3 | Claude Sonnet 4.6 | 51.94 |
| 4 | Qwen 3 14B | 44.47 |
| 5 | DeepSeek V4 Pro | 44.39 |
| 6 | GPT-5.4 Mini | 43.48 |
| 7 | Qwen Max | 39.7 |
| 8 | DeepSeek V4 Pro (Reasoning) | 37.93 |
| 9 | Llama 3.3 70B | 35.25 |
| 10 | Qwen 3 8B | 31.32 |
Interactive version: theaggregate.ai/benchmark?slug=pij-sentence-prediction · How It Works · Data refreshed daily, snapshot 2026-09-20.