Factory Code Review Benchmark — leaderboard

Metric: Mean F1 (%). Source: factory.ai. 13 models tracked.

Top models

#ModelScore
1GPT-5.260.5
2Claude Opus 4.659.8
3Claude Sonnet 4.657.4
4Claude Opus 4.755.9
5GLM-5.155.8
6GPT-5.3 Codex55.7
7Gemini 3.1 Pro (Preview)52.1
8Kimi K2.551.9
9GPT-5.4 Mini51.5
10Gemini 3 Flash49.5
11GPT-5.547.9
12GPT-5.447.5
13MiniMax-M2.745.6

Interactive version: theaggregate.ai/benchmark?slug=factory-code-review-benchmark · How the rankings work · Data refreshed daily, snapshot 2026-07-22.