NoisyBench - Random Chat History: leaderboard

Metric: Harmonic Mean Score (%; 11 datasets' pass@k, pass^k for TauBench; a random WildChat chat history added). Source: arxiv.org. Saturation forecast: Around December 2026. 7 models tracked.

Top models

#ModelScore
1Gemini 2.5 Pro62.5
2DeepSeek R1 052859.4
3Gemini 2.5 Flash56.9
4GPT-OSS-120B (High)54.9
5Qwen 3 30B A3B 2507 (Thinking)49.3
6Qwen 3 4B 2507 (Thinking)46.5
7DeepSeek R1 Distill Llama 8B23

Interactive version: theaggregate.ai/benchmark?slug=noisybench-random-chat-history · How It Works · Data refreshed daily, snapshot 2026-09-25.