Bullshit Benchmark: leaderboard

Tests whether models detect nonsense. Questions use fake precision, confident nonsense framing, cross-domain concept stitching, and other deceptive techniques. Rated green/amber/red by multiple judges.

Metric: BS Detection Rate (%). Source: petergpt.github.io. Status: years away from saturation. 188 models tracked.

Top models

#ModelScore
1Claude Opus 4.896.4
2Claude Sonnet 4.694.5
3Claude Opus 4.692.7
4Claude Opus 4.590.9
5Claude Haiku 4.587.3
6Qwen 3.8 Max87.3
7Claude Opus 4.780
8Qwen 3.8 27B76.4
9Grok 4.20 Multi-Agent67.3
10Claude Sonnet 4.565.5
11Qwen 3.5 397B A17B65.5
12Claude Sonnet 565.5
13Nemotron 3 Super65.5
14Grok 4.663.6
15Grok 4.2061.8

Interactive version: theaggregate.ai/benchmark?slug=bullshit-benchmark · How It Works · Data refreshed daily, snapshot 2026-09-05.