AutoLogi: leaderboard

1,575 English and 883 Chinese open-ended logic puzzles generated automatically from AR-LSAT and LogiQA passages by Qwen Team and Fudan (2025); JSON answers checked by program verifiers, accuracy.

Metric: Score (self-reported). Source: benchmarklist.com. Status: saturated. 8 models tracked.

Top models

#ModelScore
1GPT-4o (2024-08-06)62.04
2Claude 3.5 Sonnet60.97
3Llama 3.1 405B Instruct59.42
4Llama 3.1 70B Instruct53.79
5Qwen 2.5 72B Instruct53.5
6Qwen 2.5 7B Instruct27.28
7Llama 3.1 8B Instruct25.53
8GPT-3.5 Turbo18.93

Interactive version: theaggregate.ai/benchmark?slug=autologi · How It Works · Data refreshed daily, snapshot 2026-09-05.