AEGIS (Academic Image Forensics) - Manipulation Classification: leaderboard

Metric: Macro-F1 (%) over three classes, naming a highlighted edited region, given the original caption, as an insertion, removal or alteration, on AEGIS academic images (seven categories, 39 subtypes; real panels and forgeries from 25 generative models under four forgery strategies), zero-shot minimal prompts, lossless PNG input; higher is better. Source: arxiv.org. Saturation forecast: Around 2030. 26 models tracked.

Top models

#ModelScore
1GPT-5.148.34
2Gemini 3 Pro (Preview)45.42
3Doubao-Seed-1.6 (Thinking)41.85
4Llama 4 Maverick40.18
5GPT-4.140.05
6Claude Sonnet 4.539.7
7Gemini 2.5 Flash37.28
8Seed-1.637.08
9Qwen 2.5 VL 72B Instruct35.96
10O4 Mini (High)35.54
11Gemma 3 27B (IT)34.76
12Ministral 3 14B33.89
13Doubao-Seed-1.6-Flash30.96

Interactive version: theaggregate.ai/benchmark?slug=aegis-academic-image-forensics-manipulation-classification · How It Works · Data refreshed daily, snapshot 2026-10-07.