Mercury 2 — benchmark results

Inception's Mercury 2 diffusion LLM, generating via parallel refinement at over 1,000 tokens/s. Provider: Inception. Released 2026-02-24. Access: API.

Unified ELO 1664 ± 40, rank #334 of 1776 rated models, from 57 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
PinchBench100Success Rate (%)99.1
Story Theory Bench99.1Score (%)94.1
AA IFBench69.8Accuracy (%)83.9
SnakeBench28.1TrueSkill Rating80.8
AA Humanity's Last Exam15.52Accuracy (%)74.4
CritPt0.8Accuracy (self-reported)73.1
AA Omniscience - Software Engineering (SWE) - Dart28Accuracy (%)70.8
AA Omniscience - Software Engineering (SWE) - JavaScript40Accuracy (%)70.4
AA Omniscience - Software Engineering (SWE) - Swift48Accuracy (%)69.5
AA Terminal-Bench Hard26.52Accuracy (%)68.1
AA SciCode38.66Accuracy (%)67.9
AA CritPt0.85Accuracy (%)66.9

Interactive version: theaggregate.ai/model?slug=mercury-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.