AstroAlertBench: leaderboard
Metric: End-to-end five-class accuracy (%; 1,500 ZTF alerts, 300 each of bogus, asteroid, supernova, AGN and variable star; image triplet plus alert metadata; unparsed answers count as wrong). Source: arxiv.org. Saturation forecast: Around October 2027. 13 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | Claude Opus 4.7 (High) | 60.6 |
| 2 | GPT-5.4 (High) | 51.07 |
| 3 | Kimi K2.5 (Thinking) | 49.34 |
| 4 | Qwen 3.5 397B A17B (Thinking) | 44.27 |
| 5 | GPT-5.4 (Non-reasoning) | 43.67 |
| 6 | Gemini 2.5 Pro | 41.93 |
| 7 | Gemini 2.5 Flash (Non-reasoning) | 36.27 |
| 8 | Qwen 3.5 397B A17B (Non-reasoning) | 34.98 |
| 9 | Qwen 3.5 35B A3B (Thinking) | 26.73 |
| 10 | Qwen 3.5 35B A3B (Non-reasoning) | 25.5 |
| 11 | Qwen 3.5 4B (Non-reasoning) | 22.32 |
Interactive version: theaggregate.ai/benchmark?slug=astroalertbench · How It Works · Data refreshed daily, snapshot 2026-09-26.