Trinity Large (Thinking): benchmark results

Trinity Large evaluated with thinking enabled. Provider: Arcee AI. Released 2026-04-01. Access: Open.

Unified ELO 1584 ± 1, rank #500 of 1761 rated models, from 38 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
CritPt90Accuracy (self-reported)97.7
AA TAU-2 Bench90.06Accuracy (%)84.6
AA Omniscience - Software Engineering (SWE) - R16Accuracy (%)72.5
AA Omniscience - Software Engineering (SWE) - Java19Accuracy (%)71
AA Omniscience - Software Engineering (SWE) - Swift40Accuracy (%)70.1
AA IFBench56.26Accuracy (%)67.3
AA Omniscience - Science, Engineering & Mathematics33.7Accuracy (%)67.2
AA Humanity's Last Exam15.85Accuracy (%)66.8
AA Omniscience - Software Engineering (SWE) - PHP26Accuracy (%)65
AA Omniscience - Software Engineering (SWE) - Rust52Accuracy (%)64.7
AA Terminal-Bench Hard22.73Accuracy (%)62.6
AA CritPt0.86Accuracy (%)62.5

Interactive version: theaggregate.ai/model?slug=trinity-large-thinking · How It Works · Data refreshed daily, snapshot 2026-09-05.