SupChain-Bench (QA, With Context): leaderboard

Metric: Accuracy (%) on SupChain-Bench's 435 supply-chain knowledge questions (141 multiple-answer, 147 single-choice and 147 true/false items drafted from anonymized industry documents by a three-model pipeline and verified by domain experts); one prompt template, answer extracted by regular expression; the source document (first 2,000 characters) is prefixed to each question; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 19 models tracked.

Top models

#ModelScoreOverall rank
1GPT-583.91#91
2GPT-5 Mini83.91#176
3GPT-4.182.76#240
4Claude Sonnet 482.07#194
5Gemini 2.5 Pro80.69#145
6Qwen 3 Max80.69#201
7Claude Opus 480.69#155
8Kimi K280.68#236
9GPT-4.1 Mini80.46#346
10Claude 3.5 Sonnet80.45#337
11O3 Mini80.23#266
12DeepSeek V379.77#312
13DeepSeek R178.16#245
14Claude 3.7 Sonnet78.16#241
15Qwen 3 30B A3B77.93#488

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=supchain-bench-qa-with-context · How It Works · Data refreshed daily, snapshot 2026-10-11.