Mercury 2 — benchmark results
Inception's Mercury 2 diffusion LLM, generating via parallel refinement at over 1,000 tokens/s. Provider: Inception. Released 2026-02-24. Access: API.
Unified ELO 1664 ± 40, rank #334 of 1776 rated models, from 57 benchmark results.
Strongest benchmark results
| Benchmark | Score | Metric | Percentile |
|---|---|---|---|
| PinchBench | 100 | Success Rate (%) | 99.1 |
| Story Theory Bench | 99.1 | Score (%) | 94.1 |
| AA IFBench | 69.8 | Accuracy (%) | 83.9 |
| SnakeBench | 28.1 | TrueSkill Rating | 80.8 |
| AA Humanity's Last Exam | 15.52 | Accuracy (%) | 74.4 |
| CritPt | 0.8 | Accuracy (self-reported) | 73.1 |
| AA Omniscience - Software Engineering (SWE) - Dart | 28 | Accuracy (%) | 70.8 |
| AA Omniscience - Software Engineering (SWE) - JavaScript | 40 | Accuracy (%) | 70.4 |
| AA Omniscience - Software Engineering (SWE) - Swift | 48 | Accuracy (%) | 69.5 |
| AA Terminal-Bench Hard | 26.52 | Accuracy (%) | 68.1 |
| AA SciCode | 38.66 | Accuracy (%) | 67.9 |
| AA CritPt | 0.85 | Accuracy (%) | 66.9 |
Interactive version: theaggregate.ai/model?slug=mercury-2 · How the rankings work · Data refreshed daily, snapshot 2026-07-22.