SupChain-Bench (QA): leaderboard

Metric: Accuracy (%) on SupChain-Bench's 435 supply-chain knowledge questions (141 multiple-answer, 147 single-choice and 147 true/false items drafted from anonymized industry documents by a three-model pipeline and verified by domain experts); one prompt template, answer extracted by regular expression; no external context, testing intrinsic domain knowledge; higher is better. Source: arxiv.org. Saturation forecast: Not forecast. 19 models tracked.

Top models

#ModelScoreOverall rank
1GPT-4.168.97#240
2GPT-4.1 Mini68.05#346
3Claude 3.5 Sonnet67.81#337
4DeepSeek V367.75#312
5GPT-5 Mini66.9#176
6Claude Opus 466.7#155
7Gemini 2.5 Pro66.67#145
8Claude Sonnet 466.43#194
9GPT-566.21#91
10O3 Mini65.06#266
11Kimi K264.83#236
12DeepSeek R163.68#245
13Claude 3.7 Sonnet62.3#241
14GPT-4o62.07#333
15GPT-5 Nano61.61#415

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=supchain-bench-qa · How It Works · Data refreshed daily, snapshot 2026-10-11.