LiveNewsBench (Nov-Dec 2025): leaderboard

Metric: Accuracy (%) on LiveNewsBench's 200 human-verified questions about news events of November and December 2025, local ReAct agent with at most 5 search queries and 5 page visits per question, answers graded by GPT-4.1 with the SimpleQA grading prompt; higher is better. Source: arxiv.org. Saturation forecast: Around January 2027. 13 models tracked.

Top models

#ModelScoreOverall rank
1DeepSeek V3.2 (Thinking)84.5#198 (DeepSeek V3.2)
2DeepSeek V3.2 (Non-reasoning)83#198 (DeepSeek V3.2)
3Claude Sonnet 4.582#138
4Grok 482#169
5GPT-5.274#105
6GPT-4.172.5#240
7Qwen 3 235B A22B 2507 Instruct61.5#291
8Gemini 3 Pro60.5#77
9Qwen 3 235B A22B 2507 (Thinking)60#253 (Qwen 3 235B A22B 2507)
10Qwen 3 8B (Non-reasoning)49.5#667 (Qwen 3 8B)
11Kimi K2 (Thinking)48#236 (Kimi K2)
12GPT-OSS-120B27#330

No result here: #3 Claude Opus 5.5, #5 GPT-6 Astra, #8 Claude Fable 5.1.

Interactive version: theaggregate.ai/benchmark?slug=livenewsbench-nov-dec-2025 · How It Works · Data refreshed daily, snapshot 2026-10-11.