AstroAlertBench: leaderboard

Metric: End-to-end five-class accuracy (%; 1,500 ZTF alerts, 300 each of bogus, asteroid, supernova, AGN and variable star; image triplet plus alert metadata; unparsed answers count as wrong). Source: arxiv.org. Saturation forecast: Around October 2027. 13 models tracked.

Top models

#ModelScore
1Claude Opus 4.7 (High)60.6
2GPT-5.4 (High)51.07
3Kimi K2.5 (Thinking)49.34
4Qwen 3.5 397B A17B (Thinking)44.27
5GPT-5.4 (Non-reasoning)43.67
6Gemini 2.5 Pro41.93
7Gemini 2.5 Flash (Non-reasoning)36.27
8Qwen 3.5 397B A17B (Non-reasoning)34.98
9Qwen 3.5 35B A3B (Thinking)26.73
10Qwen 3.5 35B A3B (Non-reasoning)25.5
11Qwen 3.5 4B (Non-reasoning)22.32

Interactive version: theaggregate.ai/benchmark?slug=astroalertbench · How It Works · Data refreshed daily, snapshot 2026-09-26.