<?xml version="1.0" encoding="utf-8"?>
<?xml-stylesheet type="text/xsl" href="/feed.xsl"?>
<feed xmlns="http://www.w3.org/2005/Atom"><title>The Aggregate Digest</title><subtitle>AI benchmark changes — new models, leader shifts, and trends</subtitle><link href="https://theaggregate.ai/data/feed.xml" rel="self" /><link href="https://theaggregate.ai/whats-new?ref=atom" rel="alternate" /><id>https://theaggregate.ai/feed</id><icon>https://theaggregate.ai/favicon.svg</icon><updated>2026-08-05T06:12:14.928861+00:00</updated><entry><title>The Aggregate Digest — 2026-08-05</title><id>https://theaggregate.ai/digest/2026-08-05</id><updated>2026-08-05T06:12:14.928861+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;QuantCodeEval (Claude Code)&lt;/strong&gt; (Full Pass Rate (%)): leader Claude Opus 5 (31.33), 3 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;QuantCodeEval (Codex CLI)&lt;/strong&gt; (Full Pass Rate (%)): leader GPT-5.6 Sol (27.33), 2 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;QuantCodeEval (OpenCode)&lt;/strong&gt; (Full Pass Rate (%)): leader Kimi K3 (26.0), 11 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (29)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 98.9 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 96.6 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 98.9 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on BridgeBench Debugging: 1001.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on BridgeBench Hallucination: 1001.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on BridgeBench Refactoring: 1001.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on BridgeBench Security: 1001.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 94.4 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 96.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 98.9 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Mercor APEX: 39.9 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 97.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 97.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 100.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Scicode: 58.68 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on GameCraft-Bench: 56.96 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 93.3 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 92.1 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 97.8 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on TrackingAI IQ Test: 93.75 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on TrackingAI IQ Test (Vision): 88.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AI Chess Leaderboard (Continuation): 1165.0 (#31)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AI Chess Leaderboard (Reasoning): 1521.0 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on DeepSWE: 57.5 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on KernelBench Hub - CUDA: 28.48 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on KernelBench Hub - Hard: 33.89 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on Multi-turn Debate (Lechmazur): 1587.5 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on NYT Connections Extended: 88.9 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on Vals AI Vibe Code Bench: 64.7 (#17)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;MMOU&lt;/strong&gt;: Gemini 3.1 Pro (Preview) (82.67) beat Gemini 2.5 Pro by 18.47&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Video Editing)&lt;/strong&gt;: minimax-h3 (1395.0) beat Gemini 2.0 Flash by 14.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE Atlas - Test Writing&lt;/strong&gt;: Claude Opus 5 (Claude Code) xHigh (62.22) beat Claude Fable 5 (Claude Code) xHigh by 6.62&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMEB Leaderboard&lt;/strong&gt;: Ovis-Omni-Embedding-v0.1-3B (52.55) beat e5-omni-7B by 6.02&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE Atlas - Codebase QnA&lt;/strong&gt;: Claude Opus 5 (Claude Code) xHigh (63.17) beat Claude Opus 4.8 (Claude Code) xhigh by 5.91&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Security&lt;/strong&gt;: Claude Fable 5 (1005.3) beat GPT-5.6 Sol by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Debugging&lt;/strong&gt;: Claude Fable 5 (1005.3) beat GPT-5.6 Sol by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Refactoring&lt;/strong&gt;: Claude Fable 5 (1005.3) beat GPT-5.6 Sol by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Hallucination&lt;/strong&gt;: Claude Fable 5 (1005.3) beat GPT-5.6 Sol by 0.2&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-05

=== DAILY ===
NEW BENCHMARKS (3)
  - QuantCodeEval (Claude Code) (Full Pass Rate (%)): leader Claude Opus 5 (31.33), 3 models
  - QuantCodeEval (Codex CLI) (Full Pass Rate (%)): leader GPT-5.6 Sol (27.33), 2 models
  - QuantCodeEval (OpenCode) (Full Pass Rate (%)):</summary></entry><entry><title>The Aggregate Digest — 2026-08-04</title><id>https://theaggregate.ai/digest/2026-08-04</id><updated>2026-08-04T06:18:08.392163+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Security&lt;/strong&gt; (Confidence-weighted Elo): leader GPT-5.6 Sol (1005.1), 4 models&lt;br&gt;&lt;span&gt;AI code security benchmark: 30 expert-level security tasks across 6 domains with 500+ test cases including adversarial hidden edge cases.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Refactoring&lt;/strong&gt; (Confidence-weighted Elo): leader GPT-5.6 Sol (1005.1), 4 models&lt;br&gt;&lt;span&gt;AI code refactoring benchmark: 15 tasks measuring behavior preservation, hidden regression resistance, and structural intent compliance.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Hallucination&lt;/strong&gt; (Confidence-weighted Elo): leader GPT-5.6 Sol (1005.1), 4 models&lt;br&gt;&lt;span&gt;AI code hallucination benchmark: 30 tasks across 6 clusters with 175 questions measuring fabrication rate and accuracy in coding contexts.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (21)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on BridgeBench Debugging: 1005.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Critpt: 5.14 (#55)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Scicode: 47.11 (#52)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on MirrorCode: 20.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SWE-rebench: 62.34 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Vending Bench 2: 5165.04 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on InferenceBench: 5.7 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on BenchLM: 78.2 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on LLM Stats (DeepSWE 1.1): 56.6 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on LLM Stats (FrontierSWE): 73.5 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on LLM Stats (ScreenSpot Pro): 84.5 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on LLM Stats (Terminal-Bench 2.1): 86.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on LLM Stats Score: 52.56 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on LM Market Cap LMC Score: 80.4 (#58)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on MLS-Bench Lite: 41.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on Roboflow Playground Object Detection: 1213.0 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on Roboflow Playground Overall: 1213.0 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on Vals AI (Vals Index): 66.12 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on Vals AI CorpFin v2: 65.85 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 67.42 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on ZeroEval GPQA Diamond: 92.6 (#12)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (18)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (SkillsBench)&lt;/strong&gt;: Qwen 3.8 Max (70.2) beat Qwen 3.7 Max by 11.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - KMMLU-HARD&lt;/strong&gt;: GPT-5.6 Sol (85.04) beat GPT-5.2 (Medium) by 10.41&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MirrorCode&lt;/strong&gt;: Claude Fable 5 (63.9) beat Claude Opus 4.7 by 7.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (ERQA)&lt;/strong&gt;: Qwen 3.8 Max (77.8) beat Seed 2.1 Pro by 5.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - CLIcK&lt;/strong&gt;: GPT-5.6 Sol (95.5) beat GPT-5.2 (Medium) by 4.58&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (LVBench)&lt;/strong&gt;: Qwen 3.8 Max (81.8) beat Seed 2.1 Pro by 3.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (LongBench v2)&lt;/strong&gt;: Qwen 3.8 Max (66.3) beat Qwen 3.5 397B A17B by 3.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - HAE-RAE Bench&lt;/strong&gt;: GPT-5.6 Sol (94.64) beat GPT-5.2 (Medium) by 2.83&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (VideoMME w sub.)&lt;/strong&gt;: Qwen 3.8 Max (90.4) beat Qwen 3.6 27B by 2.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Spider 2.0-Lite&lt;/strong&gt;: GLM-5.2 (76.23) beat ktx by 2.56&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (HealthBench)&lt;/strong&gt;: Qwen 3.8 Max (60.2) beat Kimi K2 (0905) (Thinking) by 2.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SWE-rebench&lt;/strong&gt;: Claude Fable 5 [high] (64.5) beat GPT-5.5 (xHigh) by 1.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (NL2Repo)&lt;/strong&gt;: Qwen 3.8 Max (55.9) beat DeepSeek V4 Flash (0731) by 1.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (OSWorld-Verified)&lt;/strong&gt;: Qwen 3.8 Max (86.1) beat Claude Fable 5 by 1.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (RealWorldQA)&lt;/strong&gt;: Qwen 3.8 Max (88.0) beat Qwen 3.7 Plus by 1.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ForecastBench&lt;/strong&gt;: captain-jack (68.9) beat Cassi-2026-05-10 by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;InferenceBench&lt;/strong&gt;: Claude Opus 5 (8.9) beat Claude Fable 5 (Low) by 0.16&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProphetArena&lt;/strong&gt;: Gemini 3.6 Flash (0.978) beat Gemini 3.1 Pro (Preview) by 0.03&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-04

=== DAILY ===
NEW BENCHMARKS (3)
  - BridgeBench Security (Confidence-weighted Elo): leader GPT-5.6 Sol (1005.1), 4 models
      AI code security benchmark: 30 expert-level security tasks across 6 domains with 500+ test cases including adversarial hidden edge cases</summary></entry><entry><title>The Aggregate Digest — 2026-08-03</title><id>https://theaggregate.ai/digest/2026-08-03</id><updated>2026-08-03T06:38:28.867175+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Supabase Evals (Skills)&lt;/strong&gt; (Tasks Passed (%)): leader GPT-5.6 Sol (Medium) (100.0), 6 models&lt;br&gt;&lt;span&gt;Supabase Evals with the Supabase skills pack loaded: AI coding agents bootstrap and build real Supabase apps over 19 CLI tasks (migrations, RLS, auth, data APIs); percent of tasks with every check passed. Each model runs under its vendor-native harness (claude-code / codex / opencode).&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Supabase Evals (No Skills)&lt;/strong&gt; (Tasks Passed (%)): leader GPT-5.6 Sol (Low) (100.0), 6 models&lt;br&gt;&lt;span&gt;Supabase Evals without the skills pack: the same 19 CLI build tasks solved from the agent’s own knowledge of Supabase; percent of tasks with every check passed, one row per underlying model under its vendor-native harness.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hermes Best Models&lt;/strong&gt; (Pass Rate (%)): leader Gemini 2.5 Flash (100.0), 19 models&lt;br&gt;&lt;span&gt;Hermes agent-framework model evaluation: 25 agentic tasks (simple QA, multi-step tool use, delegation, reasoning, failure handling) run per LLM; task pass rate in percent, latency/cost excluded.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Agents' Last Exam)&lt;/strong&gt; (Score (%)): leader GPT-5.6 Sol (52.7), 5 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (NL2Repo)&lt;/strong&gt;: DeepSeek V4 Flash (0731) (54.2) beat GLM-5.2 by 5.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MyPCBench&lt;/strong&gt;: Claude Opus 4.8 (62.0) beat Claude Opus 4.6 by 3.8&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-03

=== DAILY ===
NEW BENCHMARKS (4)
  - Supabase Evals (Skills) (Tasks Passed (%)): leader GPT-5.6 Sol (Medium) (100.0), 6 models
      Supabase Evals with the Supabase skills pack loaded: AI coding agents bootstrap and build real Supabase apps over 19 CLI tasks (migr</summary></entry><entry><title>The Aggregate Digest — 2026-08-02</title><id>https://theaggregate.ai/digest/2026-08-02</id><updated>2026-08-02T06:27:22.986816+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (5)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;ATM-Bench Hard&lt;/strong&gt; (Oracle QS (%)): leader GPT-5.5 (71.49), 18 models&lt;br&gt;&lt;span&gt;The hard split of ATM-Bench: adversarially selected long-term memory questions. Oracle track (full context, one row per answer model); QS percent, LLM-judged.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MobileWorld - GUI Only&lt;/strong&gt; (Success Rate (%)): leader Kimi K3 (74.4), 34 models&lt;br&gt;&lt;span&gt;The GUI-only split of MobileWorld (Tongyi-MAI): 117 smartphone-environment tasks solved end-to-end from screen interaction alone; success rate %, agentic planner+grounder combos excluded.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MobileWorld - User Interaction&lt;/strong&gt; (Success Rate (%)): leader Seed 2.0 Pro (61.4), 23 models&lt;br&gt;&lt;span&gt;The user-interaction split of MobileWorld: 44 tasks requiring mid-task clarification or input from a simulated user; success rate %, end-to-end models only.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MLE-Bench Lite (Codex)&lt;/strong&gt; (Medal Average (%)): leader GPT-5.5 (68.18), 2 models&lt;br&gt;&lt;span&gt;FrontisAI OpenRSI&amp;#x27;s MLE-Bench Lite run — Kaggle-competition ML engineering with the Codex agent scaffold, 12-hour per-task budget on one RTX 4090; mean medal rate over the 22-task Lite split.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;InfoOps Bench&lt;/strong&gt; (Integrity Score (% refused)): leader Claude Opus 4.8 (96.7), 36 models&lt;br&gt;&lt;span&gt;Live safety benchmark measuring whether frontier models can be co-opted for state-backed information operations, drawn from a monitoring pipeline tracking Russian, Chinese and Iranian state-backed assets. Scored as the Integrity Score — the percentage of information-operation requests the model refused — so this measures refusal propensity rather than capability. Updated weekly.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on HieroglyphBench: 14.6 (#15)&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Weekly&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (5)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;ATM-Bench Hard&lt;/strong&gt; (Oracle QS (%)): leader GPT-5.5 (71.49), 18 models&lt;br&gt;&lt;span&gt;The hard split of ATM-Bench: adversarially selected long-term memory questions. Oracle track (full context, one row per answer model); QS percent, LLM-judged.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MobileWorld - GUI Only&lt;/strong&gt; (Success Rate (%)): leader Kimi K3 (74.4), 34 models&lt;br&gt;&lt;span&gt;The GUI-only split of MobileWorld (Tongyi-MAI): 117 smartphone-environment tasks solved end-to-end from screen interaction alone; success rate %, agentic planner+grounder combos excluded.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MobileWorld - User Interaction&lt;/strong&gt; (Success Rate (%)): leader Seed 2.0 Pro (61.4), 23 models&lt;br&gt;&lt;span&gt;The user-interaction split of MobileWorld: 44 tasks requiring mid-task clarification or input from a simulated user; success rate %, end-to-end models only.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MLE-Bench Lite (Codex)&lt;/strong&gt; (Medal Average (%)): leader GPT-5.5 (68.18), 2 models&lt;br&gt;&lt;span&gt;FrontisAI OpenRSI&amp;#x27;s MLE-Bench Lite run — Kaggle-competition ML engineering with the Codex agent scaffold, 12-hour per-task budget on one RTX 4090; mean medal rate over the 22-task Lite split.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;InfoOps Bench&lt;/strong&gt; (Integrity Score (% refused)): leader Claude Opus 4.8 (96.7), 36 models&lt;br&gt;&lt;span&gt;Live safety benchmark measuring whether frontier models can be co-opted for state-backed information operations, drawn from a monitoring pipeline tracking Russian, Chinese and Iranian state-backed assets. Scored as the Integrity Score — the percentage of information-operation requests the model refused — so this measures refusal propensity rather than capability. Updated weekly.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (92)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; — ELO 1787, #1&lt;ul&gt;&lt;li&gt;GBA Eval: 0.796 (#1/23)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Mega: 24.29 (#1/10)&lt;/li&gt;&lt;li&gt;KernelBench Hub - CUDA: 196.1 (#1/6)&lt;/li&gt;&lt;li&gt;HiL-Bench: 57.0 (#1/15)&lt;/li&gt;&lt;li&gt;FoodTruckBench: 75264.0 (#1/10)&lt;/li&gt;&lt;li&gt;Vending-Bench 2: 11181.87 (#1/58)&lt;/li&gt;&lt;li&gt;Gert Labs Rankings: 75.81 (#1/91)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Technology: 91.51 (#1/227)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 88.99 (#1/219)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Hard: 52.61 (#2/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; — ELO 1779, #3&lt;ul&gt;&lt;li&gt;MWS Vision Bench: 79.9 (#1/46)&lt;/li&gt;&lt;li&gt;ProphetArena: 0.9503 (#2/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; — ELO 1778, #4&lt;ul&gt;&lt;li&gt;Vals AI Time Horizon Index: 13.0 (#1/6)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Temporal: 46.25 (#1/17)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Video QA: 77.9 (#1/17)&lt;/li&gt;&lt;li&gt;MWS Vision Bench: 79.0 (#2/46)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench: 69.03 (#2/17)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Semantic: 76.9 (#2/17)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Event Verification: 75.9 (#2/17)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Single Object Tracking: 75.02 (#2/17)&lt;/li&gt;&lt;li&gt;Design Arena (SVG): 1341.0 (#3/102)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Spatial: 77.93 (#4/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; — ELO 1762, #6&lt;ul&gt;&lt;li&gt;SWE-Milestone: 46.75 (#2/24)&lt;/li&gt;&lt;li&gt;Ramp SWE-Bench: 87.18 (#3/27)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 58.68 (#3/102)&lt;/li&gt;&lt;li&gt;MWS Vision Bench: 77.7 (#4/46)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 70.0 (#5/50)&lt;/li&gt;&lt;li&gt;Vals AI Time Horizon Index: 5.17 (#5/6)&lt;/li&gt;&lt;li&gt;Epoch AI - Apex Agents: 39.3 (#7/55)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test (Offline): 81.25 (#7/39)&lt;/li&gt;&lt;li&gt;Epoch AI - Blueprint Bench 2: 29.5 (#8/21)&lt;/li&gt;&lt;li&gt;Blueprint-Bench 2: 0.295 (#8/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.6 Flash&lt;/strong&gt; — ELO 1757, #7&lt;ul&gt;&lt;li&gt;MathArena - Kangaroo 2025 Levels 9-10: 100.0 (#1/22)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench: 69.52 (#1/17)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Semantic: 79.41 (#1/17)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Event Verification: 82.0 (#1/17)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Single Object Tracking: 75.99 (#1/17)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Spatial: 78.85 (#2/17)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Temporal: 43.83 (#2/17)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Video QA: 76.82 (#2/17)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Vision): 1301.0 (#3/143)&lt;/li&gt;&lt;li&gt;MathArena - Kangaroo 2025 Levels 5-6: 88.33 (#3/22)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5&lt;/strong&gt; — ELO 1753, #8&lt;ul&gt;&lt;li&gt;MWS Vision Bench: 77.8 (#3/46)&lt;/li&gt;&lt;li&gt;Epoch AI - Rli: 6.25 (#4/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; — ELO 1749, #9&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 58.22 (#4/102)&lt;/li&gt;&lt;li&gt;Epoch AI - Apex Agents: 41.9 (#4/55)&lt;/li&gt;&lt;li&gt;BridgeBench Debugging: 1000.2 (#6/14)&lt;/li&gt;&lt;li&gt;Vending-Bench 2: 6520.47 (#9/58)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Document): 1472.0 (#13/38)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Vision): 1283.0 (#14/143)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1536.36 (#15/97)&lt;/li&gt;&lt;li&gt;ProphetArena: 0.9285 (#17/21)&lt;/li&gt;&lt;li&gt;Wolfram LLM Benchmarking Project: 67.8 (#23/528)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 155.49 (#67/450)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Pro (Preview)&lt;/strong&gt; — ELO 1742, #10&lt;ul&gt;&lt;li&gt;APEX v1 Consulting: 66.7 (#2/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 63.4 (#3/18)&lt;/li&gt;&lt;li&gt;APEX v1: 65.1 (#4/4)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 62.7 (#4/18)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 67.6 (#13/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash&lt;/strong&gt; — ELO 1737, #12&lt;ul&gt;&lt;li&gt;BridgeBench Debugging: 994.9 (#12/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; — ELO 1736, #13&lt;ul&gt;&lt;li&gt;BridgeBench Debugging: 1005.1 (#1/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.5&lt;/strong&gt; — ELO 1735, #14&lt;ul&gt;&lt;li&gt;Agents' Last Exam: 27.0 (#5/22)&lt;/li&gt;&lt;li&gt;Kaggle FACTS (Google): 50.2 (#13/32)&lt;/li&gt;&lt;li&gt;Kaggle FACTS Parametric: 46.83 (#14/36)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Vision): 1282.0 (#16/143)&lt;/li&gt;&lt;li&gt;ProphetArena: 0.9284 (#18/21)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Document): 1454.0 (#20/38)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Terra&lt;/strong&gt; — ELO 1734, #15&lt;ul&gt;&lt;li&gt;MWS Vision Bench: 74.9 (#5/46)&lt;/li&gt;&lt;li&gt;Senior SWE-Bench: 27.4 (#7/10)&lt;/li&gt;&lt;li&gt;Kaggle FACTS (Google): 52.0 (#11/32)&lt;/li&gt;&lt;li&gt;Lean AI Formalization Leaderboard: 0.0 (#51/51)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4&lt;/strong&gt; — ELO 1721, #18&lt;ul&gt;&lt;li&gt;APEX v1: 67.2 (#1/4)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 64.5 (#2/18)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 74.3 (#3/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 65.9 (#3/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 64.0 (#3/18)&lt;/li&gt;&lt;li&gt;Epoch AI - Apex Agents: 34.9 (#12/55)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 5.0 (#80/86)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 57.78 (#92/174)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Pro&lt;/strong&gt; — ELO 1720, #19&lt;ul&gt;&lt;li&gt;APEX v1 Investment Banking: 59.7 (#8/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 58.6 (#10/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 58.4 (#12/18)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 66.8 (#15/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.7&lt;/strong&gt; — ELO 1715, #21&lt;ul&gt;&lt;li&gt;BridgeBench Debugging: 999.8 (#8/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Flash&lt;/strong&gt; — ELO 1713, #23&lt;ul&gt;&lt;li&gt;APEX v1 Investment Banking: 59.8 (#6/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 59.9 (#9/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 58.0 (#15/18)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 66.0 (#16/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.2&lt;/strong&gt; — ELO 1712, #25&lt;ul&gt;&lt;li&gt;ProgramBench Almost: 8.5 (#3/15)&lt;/li&gt;&lt;li&gt;ProgramBench: 0.0 (#4/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Luna&lt;/strong&gt; — ELO 1712, #26&lt;ul&gt;&lt;li&gt;MWS Vision Bench: 72.7 (#9/46)&lt;/li&gt;&lt;li&gt;Kaggle FACTS Parametric: 25.0 (#23/36)&lt;/li&gt;&lt;li&gt;Kaggle FACTS (Google): 34.78 (#30/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 5&lt;/strong&gt; — ELO 1712, #27&lt;ul&gt;&lt;li&gt;Design Arena (Game Dev): 1352.0 (#4/143)&lt;/li&gt;&lt;li&gt;MWS Vision Bench: 73.1 (#8/46)&lt;/li&gt;&lt;li&gt;BridgeBench Debugging: 999.8 (#9/14)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test (Vision): 49.02 (#13/24)&lt;/li&gt;&lt;li&gt;Design Arena (3D): 1313.0 (#14/135)&lt;/li&gt;&lt;li&gt;Design Arena (UI Components): 1309.0 (#15/140)&lt;/li&gt;&lt;li&gt;Design Arena (Website): 1298.0 (#17/161)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test: 68.75 (#20/38)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test (Offline): 62.5 (#20/39)&lt;/li&gt;&lt;li&gt;Design Arena (Data Viz): 1265.0 (#27/142)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.3 Codex&lt;/strong&gt; — ELO 1711, #28&lt;ul&gt;&lt;li&gt;APEX v1 Investment Banking: 65.0 (#1/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 65.5 (#4/18)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 69.8 (#12/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 58.1 (#14/18)&lt;/li&gt;&lt;li&gt;Epoch AI - Apex Agents: 31.8 (#20/55)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.6&lt;/strong&gt; — ELO 1710, #29&lt;ul&gt;&lt;li&gt;APEX v1 Medicine (MD): 71.6 (#1/18)&lt;/li&gt;&lt;li&gt;APEX v1: 65.7 (#2/4)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 76.4 (#2/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 62.5 (#5/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 53.4 (#13/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2 Codex&lt;/strong&gt; — ELO 1710, #31&lt;ul&gt;&lt;li&gt;APEX v1 Consulting: 66.9 (#1/18)&lt;/li&gt;&lt;li&gt;APEX v1: 65.3 (#3/4)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 61.8 (#5/18)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 73.0 (#8/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 59.7 (#9/18)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1303.0 (#32/306)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 1151.0 (#33/251)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.7 Code&lt;/strong&gt; — ELO 1706, #33&lt;ul&gt;&lt;li&gt;Mercor APEX: 27.6 (#20/52)&lt;/li&gt;&lt;li&gt;Epoch AI - Apex Agents: 27.6 (#23/55)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok Build 0.1&lt;/strong&gt; — ELO 1704, #34&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 50.23 (#30/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Plus&lt;/strong&gt; — ELO 1702, #35&lt;ul&gt;&lt;li&gt;Epoch AI - Critpt: 9.14 (#40/110)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 45.49 (#46/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2&lt;/strong&gt; — ELO 1699, #37&lt;ul&gt;&lt;li&gt;APEX v1 Investment Banking: 62.3 (#4/18)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 73.4 (#6/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 61.4 (#6/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 61.9 (#6/18)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 4.0 (#82/86)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 62.22 (#88/174)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.5&lt;/strong&gt; — ELO 1699, #38&lt;ul&gt;&lt;li&gt;APEX v1 Medicine (MD): 61.5 (#7/18)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 70.1 (#10/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 51.1 (#16/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 46.7 (#17/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; — ELO 1699, #39&lt;ul&gt;&lt;li&gt;Design Arena (Website): 1243.0 (#46/161)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1417.36 (#47/97)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5&lt;/strong&gt; — ELO 1695, #43&lt;ul&gt;&lt;li&gt;APEX v1 Big Law: 76.6 (#1/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 62.4 (#5/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 60.0 (#8/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 59.1 (#9/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.6&lt;/strong&gt; — ELO 1691, #44&lt;ul&gt;&lt;li&gt;BridgeBench Debugging: 1005.1 (#3/14)&lt;/li&gt;&lt;li&gt;MWS Vision Bench: 74.3 (#6/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro&lt;/strong&gt; — ELO 1691, #45&lt;ul&gt;&lt;li&gt;BridgeBench Debugging: 1005.1 (#2/14)&lt;/li&gt;&lt;li&gt;Onyx Open LLM Leaderboard: 87.5 (#3/19)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Mega: 1.38 (#10/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hy3&lt;/strong&gt; — ELO 1691, #46&lt;ul&gt;&lt;li&gt;Chatbot Arena (Text): 1456.0 (#50/384)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Codex&lt;/strong&gt; — ELO 1691, #47&lt;ul&gt;&lt;li&gt;APEX v1 Big Law: 73.5 (#5/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 60.3 (#7/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 59.8 (#7/18)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1777.0 (#7/306)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 57.6 (#16/18)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 1291.0 (#24/251)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling Small&lt;/strong&gt; — ELO 1688, #50&lt;ul&gt;&lt;li&gt;SEAL - AudioMultiChallenge: 54.87 (#2/33)&lt;/li&gt;&lt;li&gt;SEAL - AudioMultiChallenge - Text Output: 54.87 (#2/18)&lt;/li&gt;&lt;li&gt;Vals AI CorpFin v2: 69.62 (#5/128)&lt;/li&gt;&lt;li&gt;SEAL - MCP Atlas: 79.2 (#8/29)&lt;/li&gt;&lt;li&gt;Vals AI Public Benefits Bench: 59.41 (#16/26)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 25.48 (#18/28)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 31.76 (#27/29)&lt;/li&gt;&lt;li&gt;Vals AI Terminal-Bench 2.1: 55.06 (#28/47)&lt;/li&gt;&lt;li&gt;Vals AI (Vals Index): 50.17 (#29/42)&lt;/li&gt;&lt;li&gt;AA-Briefcase: 20.0 (#31/53)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5-Pro&lt;/strong&gt; — ELO 1685, #53&lt;ul&gt;&lt;li&gt;Onyx Open LLM Leaderboard: 68.5 (#18/19)&lt;/li&gt;&lt;li&gt;EQ-Bench Longform Writing: 73.7 (#18/125)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Codex&lt;/strong&gt; — ELO 1682, #56&lt;ul&gt;&lt;li&gt;APEX v1 Big Law: 73.2 (#7/18)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1743.0 (#8/306)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 58.7 (#10/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 57.6 (#11/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 58.1 (#13/18)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 1418.0 (#15/251)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.6&lt;/strong&gt; — ELO 1681, #57&lt;ul&gt;&lt;li&gt;APEX v1 Medicine (MD): 66.7 (#2/18)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 72.3 (#9/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 41.9 (#18/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 36.9 (#18/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3&lt;/strong&gt; — ELO 1681, #58&lt;ul&gt;&lt;li&gt;APEX v1 Big Law: 73.6 (#4/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 59.1 (#10/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 55.3 (#11/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 54.1 (#13/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash Lite&lt;/strong&gt; — ELO 1677, #61&lt;ul&gt;&lt;li&gt;Agent Arena - Confirmed Success: 17.21 (#2/44)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Event Verification: 70.41 (#5/17)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 17.63 (#6/44)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Single Object Tracking: 55.77 (#6/17)&lt;/li&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.45 (#7/44)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Semantic: 68.01 (#7/17)&lt;/li&gt;&lt;li&gt;Agent Arena: 10.2 (#8/44)&lt;/li&gt;&lt;li&gt;SvelteBench: 100.0 (#8/155)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench: 52.89 (#8/17)&lt;/li&gt;&lt;li&gt;Kaggle FACTS (Google): 53.46 (#9/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.3&lt;/strong&gt; — ELO 1676, #62&lt;ul&gt;&lt;li&gt;Epoch AI - Critpt: 0.0 (#102/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Mini&lt;/strong&gt; — ELO 1675, #65&lt;ul&gt;&lt;li&gt;Epoch AI - Apex Agents: 24.6 (#24/55)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash&lt;/strong&gt; — ELO 1674, #67&lt;ul&gt;&lt;li&gt;Onyx Open LLM Leaderboard: 86.2 (#5/19)&lt;/li&gt;&lt;li&gt;Ramp SWE-Bench: 79.49 (#11/27)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.1 (20250805)&lt;/strong&gt; — ELO 1664, #77&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 7.0 (#73/86)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 27B&lt;/strong&gt; — ELO 1662, #81&lt;ul&gt;&lt;li&gt;Onyx Open LLM Leaderboard: 86.2 (#6/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Step 3.7 Flash&lt;/strong&gt; — ELO 1659, #86&lt;ul&gt;&lt;li&gt;Epoch AI - Critpt: 2.29 (#57/110)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 40.05 (#66/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Mini&lt;/strong&gt; — ELO 1652, #90&lt;ul&gt;&lt;li&gt;Epoch AI - Critpt: 0.0 (#110/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5&lt;/strong&gt; — ELO 1652, #92&lt;ul&gt;&lt;li&gt;Epoch AI - Critpt: 3.71 (#52/110)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 43.06 (#53/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3 Ultra&lt;/strong&gt; — ELO 1648, #98&lt;ul&gt;&lt;li&gt;Onyx Open LLM Leaderboard: 86.8 (#4/19)&lt;/li&gt;&lt;li&gt;BridgeBench Debugging: 1000.2 (#7/14)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 142.67 (#238/450)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Chat&lt;/strong&gt; — ELO 1639, #115&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 1465.0 (#13/251)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 847.0 (#83/306)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 35B A3B&lt;/strong&gt; — ELO 1637, #118&lt;ul&gt;&lt;li&gt;Onyx Open LLM Leaderboard: 85.2 (#9/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ring-2.6-1T&lt;/strong&gt; — ELO 1634, #123&lt;ul&gt;&lt;li&gt;Epoch AI - Critpt: 3.71 (#51/110)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 42.36 (#57/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.7&lt;/strong&gt; — ELO 1627, #139&lt;ul&gt;&lt;li&gt;BridgeBench Debugging: 994.9 (#14/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Codex Mini&lt;/strong&gt; — ELO 1620, #151&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 952.0 (#63/306)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 812.0 (#68/251)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 31B&lt;/strong&gt; — ELO 1619, #153&lt;ul&gt;&lt;li&gt;Onyx Open LLM Leaderboard: 85.2 (#8/19)&lt;/li&gt;&lt;li&gt;BridgeBench Debugging: 994.9 (#13/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Haiku 4.5&lt;/strong&gt; — ELO 1617, #157&lt;ul&gt;&lt;li&gt;BridgeBench Debugging: 1000.2 (#5/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Nano&lt;/strong&gt; — ELO 1605, #178&lt;ul&gt;&lt;li&gt;Epoch AI - Apex Agents: 16.9 (#36/55)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3 Chat&lt;/strong&gt; — ELO 1602, #183&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 1.0 (#84/86)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 48.89 (#102/174)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Medium 3.5&lt;/strong&gt; — ELO 1601, #186&lt;ul&gt;&lt;li&gt;BridgeBench Debugging: 999.8 (#10/14)&lt;/li&gt;&lt;li&gt;Bongard Problems (Classic): 6.9 (#11/15)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 142.46 (#243/450)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen3 Coder Next&lt;/strong&gt; — ELO 1600, #190&lt;ul&gt;&lt;li&gt;Vector Eval - MATH: 97.82 (#1/12)&lt;/li&gt;&lt;li&gt;Vector Eval - GPQA-D: 75.63 (#1/12)&lt;/li&gt;&lt;li&gt;Vector Eval - InterCode-CTF: 85.9 (#1/6)&lt;/li&gt;&lt;li&gt;Vector Eval - GAIA: 36.36 (#2/6)&lt;/li&gt;&lt;li&gt;Vector Eval - GSM8K: 95.83 (#3/12)&lt;/li&gt;&lt;li&gt;Vector Eval - MMLU-Pro: 82.46 (#3/12)&lt;/li&gt;&lt;li&gt;Vector Eval - In-House-CTF: 38.46 (#3/6)&lt;/li&gt;&lt;li&gt;Vector Eval - ARC-E: 98.82 (#4/12)&lt;/li&gt;&lt;li&gt;Vector Eval - DROP: 87.91 (#4/9)&lt;/li&gt;&lt;li&gt;Vector Eval - HumanEval: 91.46 (#5/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Medium 3.1&lt;/strong&gt; — ELO 1596, #198&lt;ul&gt;&lt;li&gt;Bongard Problems (Classic): 11.5 (#5/15)&lt;/li&gt;&lt;li&gt;Guesswork: 0.9902 (#23/35)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 33.8 (#84/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-OSS-120B&lt;/strong&gt; — ELO 1595, #200&lt;ul&gt;&lt;li&gt;Epoch AI - Apex Agents: 4.7 (#49/55)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mercury 2&lt;/strong&gt; — ELO 1595, #201&lt;ul&gt;&lt;li&gt;Epoch AI - Critpt: 0.85 (#69/110)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 38.66 (#72/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3 Super&lt;/strong&gt; — ELO 1592, #205&lt;ul&gt;&lt;li&gt;Onyx Open LLM Leaderboard: 83.7 (#14/19)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 36.0 (#76/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 3&lt;/strong&gt; — ELO 1588, #210&lt;ul&gt;&lt;li&gt;Guesswork: 1.0511 (#14/35)&lt;/li&gt;&lt;li&gt;Bongard Problems (Classic): 5.1 (#15/15)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 36.23 (#74/102)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1229.89 (#91/97)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 0.0 (#101/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 Mini&lt;/strong&gt; — ELO 1586, #217&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 7.0 (#75/86)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3&lt;/strong&gt; — ELO 1580, #236&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 35.42 (#81/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o (2024-08-06)&lt;/strong&gt; — ELO 1579, #240&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 13.0 (#62/86)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Magistral Medium 1.2&lt;/strong&gt; — ELO 1577, #243&lt;ul&gt;&lt;li&gt;Guesswork: 1.275 (#6/35)&lt;/li&gt;&lt;li&gt;Bongard Problems (Classic): 6.6 (#12/15)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 39.24 (#70/102)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 0.29 (#77/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small 4&lt;/strong&gt; — ELO 1568, #258&lt;ul&gt;&lt;li&gt;Bongard Problems (Classic): 5.6 (#14/15)&lt;/li&gt;&lt;li&gt;Guesswork: 0.9222 (#28/35)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Devstral Small 2&lt;/strong&gt; — ELO 1566, #261&lt;ul&gt;&lt;li&gt;Guesswork: 1.0495 (#15/35)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Opus (20240229)&lt;/strong&gt; — ELO 1564, #265&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 5.0 (#79/86)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.7 Flash&lt;/strong&gt; — ELO 1562, #270&lt;ul&gt;&lt;li&gt;ReasonScape R12: 596.84 (#68/85)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Magistral Small 1.2&lt;/strong&gt; — ELO 1560, #278&lt;ul&gt;&lt;li&gt;Guesswork: 1.2208 (#8/35)&lt;/li&gt;&lt;li&gt;Bongard Problems (Classic): 6.6 (#13/15)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 0.29 (#78/110)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 35.19 (#82/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 Turbo&lt;/strong&gt; — ELO 1557, #287&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 6.0 (#77/86)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 127.26 (#349/450)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Solar Pro 3&lt;/strong&gt; — ELO 1555, #293&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 24.65 (#97/102)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 0.0 (#103/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.3 70B Instruct&lt;/strong&gt; — ELO 1545, #317&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 26.04 (#93/102)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 0.0 (#97/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small 3.2&lt;/strong&gt; — ELO 1545, #318&lt;ul&gt;&lt;li&gt;Guesswork: 1.2168 (#9/35)&lt;/li&gt;&lt;li&gt;Bongard Problems (Classic): 8.3 (#10/15)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 26.39 (#92/102)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 0.0 (#107/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Medium 3&lt;/strong&gt; — ELO 1544, #321&lt;ul&gt;&lt;li&gt;Bongard Problems (Classic): 9.3 (#7/15)&lt;/li&gt;&lt;li&gt;Guesswork: 1.0598 (#13/35)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small 3.1&lt;/strong&gt; — ELO 1536, #337&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 26.5 (#91/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral 3 14B&lt;/strong&gt; — ELO 1525, #360&lt;ul&gt;&lt;li&gt;Bongard Problems (Classic): 9.8 (#6/15)&lt;/li&gt;&lt;li&gt;Guesswork: 1.0049 (#22/35)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral 3 8B&lt;/strong&gt; — ELO 1513, #383&lt;ul&gt;&lt;li&gt;Guesswork: 1.2684 (#7/35)&lt;/li&gt;&lt;li&gt;Bongard Problems (Classic): 8.6 (#9/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o Mini (2024-07-18)&lt;/strong&gt; — ELO 1511, #388&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 0.0 (#86/86)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 12B (IT)&lt;/strong&gt; — ELO 1510, #390&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 17.36 (#99/102)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 0.0 (#108/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E4B&lt;/strong&gt; — ELO 1476, #445&lt;ul&gt;&lt;li&gt;ReasonScape R12: 609.87 (#65/85)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-4 Mini Instruct&lt;/strong&gt; — ELO 1405, #571&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 10.76 (#102/102)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 0.0 (#104/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Celeris-1&lt;/strong&gt; — ELO 1521&lt;ul&gt;&lt;li&gt;AA GDPval: 533.56 (#135/179)&lt;/li&gt;&lt;li&gt;GDPval-AA: 534.0 (#139/184)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 4.95 (#151/183)&lt;/li&gt;&lt;li&gt;BenchLM: 42.0 (#169/200)&lt;/li&gt;&lt;li&gt;AA Humanity's Last Exam: 6.63 (#287/551)&lt;/li&gt;&lt;li&gt;AA Long Context Reasoning: 27.0 (#301/483)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 63.13 (#326/555)&lt;/li&gt;&lt;li&gt;AA Omniscience - Software Engineering (SWE) - PHP: 16.0 (#332/460)&lt;/li&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 11.81 (#337/554)&lt;/li&gt;&lt;li&gt;AA Omniscience - Software Engineering (SWE) - Dart: 14.0 (#340/460)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek Reasoner&lt;/strong&gt; — ELO 1645&lt;ul&gt;&lt;li&gt;gg-bench: 22.27 (#3/7)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Codex Max&lt;/strong&gt; — ELO 1690&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 1354.0 (#19/251)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1354.0 (#30/306)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 149.96 (#125/450)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.1&lt;/strong&gt; — ELO 1657&lt;ul&gt;&lt;li&gt;APEX v1 Big Law: 70.0 (#11/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 58.4 (#11/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 52.7 (#14/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 48.8 (#15/18)&lt;/li&gt;&lt;li&gt;Epoch AI - Apex Agents: 12.8 (#41/55)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna M.1&lt;/strong&gt; — ELO 1581&lt;ul&gt;&lt;li&gt;Vals AI Public Benefits Bench: 43.84 (#25/26)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 0.0 (#50/50)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1349.08 (#72/97)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna XS.2&lt;/strong&gt; — ELO 1556&lt;ul&gt;&lt;li&gt;Vals AI Public Benefits Bench: 41.41 (#26/26)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 0.0 (#49/50)&lt;/li&gt;&lt;li&gt;Vals AI MedScribe: 61.43 (#75/77)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1303.68 (#80/97)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;codestral-2508&lt;/strong&gt; — ELO 1544&lt;ul&gt;&lt;li&gt;Guesswork: 0.9856 (#24/35)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (46)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on ProphetArena: 0.9503 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy: 91.1 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy - Maths: 95.24 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy - Primary: 95.31 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy - Science: 92.35 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy - Secondary: 89.94 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy - Social studies: 82.73 (#70)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Blueprint-Bench 2: 0.304 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Design Arena (3D): 1382.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on HieroglyphBench: 14.6 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Kaggle FACTS Parametric: 48.77 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Kaggle Game Arena Poker (Heads Up): 20.34 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on KernelBench Hub - Hard: 52.61 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LisanBench: 0.1144 (#38)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on MineBench: 2103.11 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpeechMap Compliance: 59.1 (#202)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on TaxCalcBench: 18.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on TrackingAI IQ Test: 82.35 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on TrackingAI IQ Test (Mensa Norway): 77.14 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on TrackingAI IQ Test (Offline): 81.25 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (SVG): 1341.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Apex Agents: 37.7 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Kaggle FACTS (Google): 52.41 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Lean AI Formalization Leaderboard: 2.0 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on MWS Vision Bench: 79.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on VANTAGE-Bench: 69.03 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on VANTAGE-Bench - Event Verification: 75.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on VANTAGE-Bench - Semantic: 76.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on VANTAGE-Bench - Single Object Tracking: 75.02 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on VANTAGE-Bench - Spatial: 77.93 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Blueprint-Bench 2: 0.295 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Apex Agents: 39.3 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Blueprint Bench 2: 29.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - ECI: 157.39 (#44)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Proofbench: 70.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Scicode: 58.68 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on MWS Vision Bench: 77.7 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Mercor APEX: 39.3 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Ramp SWE-Bench: 87.18 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SWE-Milestone: 46.75 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Senior SWE-Bench: 20.2 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on TrackingAI IQ Test (Offline): 81.25 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI ProgramBench: 62.77 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Time Horizon Index: 5.17 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vending-Bench 2: 5165.04 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vending-Bench 2: 5165.04 (#19)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (49)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;FoodTruckBench&lt;/strong&gt;: Claude Opus 5 (75264.0) beat GPT-5.5 by 13856.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Vending Bench 2&lt;/strong&gt;: Claude Opus 5 (Unknown) (11181.87) beat Claude Opus 4.7 (Unknown) by 245.11&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vending-Bench 2&lt;/strong&gt;: Claude Opus 5 (11181.87) beat Claude Opus 4.7 by 245.11&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KernelBench Hub - CUDA&lt;/strong&gt;: Claude Opus 5 (196.1) beat Claude Fable 5 by 123.44&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WebDev Arena&lt;/strong&gt;: Claude Opus 5 (Max) (1711.88) beat Claude Fable 5 (Unknown) by 57.95&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WDCD R3 Pressure Integrity&lt;/strong&gt;: Grok 4 (163.0) beat Gemini 3.1 Pro (Preview) by 25.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Code)&lt;/strong&gt;: Claude Opus 5 (Max) (1705.0) beat Kimi K3 by 23.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MathArena - ARXIV_FALSE June&lt;/strong&gt;: Claude Opus 5 (Max) (90.74) beat GPT-5.5 (xHigh) by 21.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - TeleTables&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (79.76) beat OTel-LLM-8.3B-QnA by 17.96&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Chess (Saplin)&lt;/strong&gt;: GPT-5.6 Sol (High) (1548.5) beat GPT-5.5 (Medium) by 16.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Enigma Eval&lt;/strong&gt;: Claude Fable 5 (High) (39.28) beat GPT-5.4 Pro (xHigh) by 15.46&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WDCD R2 In-Document Resistance&lt;/strong&gt;: Grok 4 (100.0) beat DeepSeek V4 Pro by 12.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench - Single Object Tracking&lt;/strong&gt;: Gemini 3.6 Flash (75.99) beat Gemini 3.1 Pro (Preview) by 11.64&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Document)&lt;/strong&gt;: Claude Opus 5 (High) (1520.0) beat Claude Opus 4.6 by 10.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench - Event Verification&lt;/strong&gt;: Gemini 3.6 Flash (82.0) beat Cosmos-Reason2-32B by 8.42&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench - Semantic&lt;/strong&gt;: Gemini 3.6 Flash (79.41) beat Cosmos-Reason2-32B by 7.47&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OSWorld&lt;/strong&gt;: Intelligence-Indeed Agent (90.19) beat Pointer Agent w/ Opus 4.7 by 6.55&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench&lt;/strong&gt;: Gemini 3.6 Flash (69.52) beat Cosmos3-Super by 6.51&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MWS Vision Bench&lt;/strong&gt;: Claude Fable 5 (79.9) beat Cotype Pro 3 by 6.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench - Video QA&lt;/strong&gt;: GPT-5.6 Sol (77.9) beat Gemini 3.1 Pro (Preview) by 6.02&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - 3GPP&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (87.34) beat OTel-LLM-8.3B-QnA by 5.94&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench - Temporal&lt;/strong&gt;: GPT-5.6 Sol (46.25) beat Gemini 3.1 Pro (Preview) by 5.51&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KernelBench Hub - Mega&lt;/strong&gt;: Claude Opus 5 (24.29) beat Claude Fable 5 by 5.17&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProfBench&lt;/strong&gt;: Claude Opus 5 (Thinking) (66.2) beat Claude Opus 4.7 (Thinking) by 4.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco LLM Leaderboard&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (90.27) beat OTel-LLM-8.3B-QnA by 4.29&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OckBench&lt;/strong&gt;: opus-5 (xHigh) (95.0) beat opus-4.8 (xHigh) by 3.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gert Labs Rankings&lt;/strong&gt;: Claude Opus 5 (75.81) beat Claude Fable 5 by 3.03&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProgramBench Almost&lt;/strong&gt;: Claude Opus 4.8 (xHigh) (16.5) beat GPT-5.5 (xHigh) by 3.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - TeleMath&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (89.8) beat OTel-LLM-8.3B-QnA by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PutnamBench&lt;/strong&gt;: Humanfia (w/ GPT 5.5) (670.0) beat Aleph Prover (Logical Intelligence) by 2.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TrackingAI IQ Test (Vision)&lt;/strong&gt;: GPT-Luna-Max (96.08) beat GPT-5.6 Terra (Ultra) by 1.96&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PTEB&lt;/strong&gt;: F2LLM-v2-4B (77.49) beat embeddinggemma-300m by 1.94&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Pedagogy - Technology&lt;/strong&gt;: Claude Opus 5 (91.51) beat Kimi K2.5 by 1.89&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - srsRAN-Bench&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (91.54) beat OTel-LLM-8.3B-QnA by 1.86&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - TeleLogs&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (98.15) beat OTel-LLM-8.3B-QnA by 1.85&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SpreadsheetBench&lt;/strong&gt;: Qingqiu Agent (98.25) beat Data Analysis Agent by 1.75&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Praise vs Complaint&lt;/strong&gt;: Claude Opus 5 (Max) (25.63) beat Claude Fable 5 (High) by 1.69&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Time Horizon Index&lt;/strong&gt;: GPT-5.6 Sol (13.0) beat Claude Opus 4.8 by 1.17&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena&lt;/strong&gt;: Gemma 4 31B (16.1) beat Grok 4.3 by 1.06&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Debugging&lt;/strong&gt;: Claude Opus 4.8 (1005.1) beat Gemini 3.1 Pro (Preview) by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vector Eval - MATH&lt;/strong&gt;: Qwen3 Coder Next (97.82) beat O3 Mini by 0.91&lt;/li&gt;&lt;li&gt;&lt;strong&gt;HiL-Bench&lt;/strong&gt;: Claude Opus 5 (57.0) beat Claude Fable 5 by 0.67&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Tau3 Banking&lt;/strong&gt;: Kimi K3 (Low) (34.02) beat Kimi K3 by 0.62&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - TeleQnA&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (91.7) beat OTel-LLM-8.3B-QnA by 0.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education SEND&lt;/strong&gt;: Claude Opus 5 (88.99) beat Gemini 3.6 Flash by 0.46&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Confirmed Success&lt;/strong&gt;: Claude Opus 5 (Max) (17.56) beat MiniMax-M2.7 by 0.43&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vector Eval - InterCode-CTF&lt;/strong&gt;: Qwen3 Coder Next (85.9) beat Claude 3.5 Sonnet by 0.33&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vector Eval - GPQA-D&lt;/strong&gt;: Qwen3 Coder Next (75.63) beat O1 by 0.12&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GBA Eval&lt;/strong&gt;: Claude Opus 5 (0.796) beat Claude Fable 5 by 0.05&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-02

=== DAILY ===
NEW BENCHMARKS (5)
  - ATM-Bench Hard (Oracle QS (%)): leader GPT-5.5 (71.49), 18 models
      The hard split of ATM-Bench: adversarially selected long-term memory questions. Oracle track (full context, one row per answer model); QS percent, LLM-judge</summary></entry><entry><title>The Aggregate Digest — 2026-08-01</title><id>https://theaggregate.ai/digest/2026-08-01</id><updated>2026-08-01T06:28:22.655980+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LM Market Cap LMC Score&lt;/strong&gt; (LMC Score (0-100)): leader Claude Fable 5 (97.1), 342 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats Score&lt;/strong&gt; (LLM Stats Score (conservative rating)): leader GPT-5.6 Sol (58.05), 320 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Celeris-1&lt;/strong&gt; — ELO 1518&lt;ul&gt;&lt;li&gt;AA GDPval: 533.56 (#135/179)&lt;/li&gt;&lt;li&gt;GDPval-AA: 534.0 (#139/184)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 4.95 (#151/183)&lt;/li&gt;&lt;li&gt;BenchLM: 42.0 (#169/200)&lt;/li&gt;&lt;li&gt;AA Humanity's Last Exam: 6.63 (#287/551)&lt;/li&gt;&lt;li&gt;AA Long Context Reasoning: 27.0 (#301/483)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 63.13 (#326/555)&lt;/li&gt;&lt;li&gt;AA Omniscience - Software Engineering (SWE) - PHP: 16.0 (#332/460)&lt;/li&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 11.81 (#337/554)&lt;/li&gt;&lt;li&gt;AA Omniscience - Software Engineering (SWE) - Dart: 14.0 (#340/460)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (SVG): 1341.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Senior SWE-Bench: 20.2 (#10)&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-01

=== DAILY ===
NEW BENCHMARKS (2)
  - LM Market Cap LMC Score (LMC Score (0-100)): leader Claude Fable 5 (97.1), 342 models
  - LLM Stats Score (LLM Stats Score (conservative rating)): leader GPT-5.6 Sol (58.05), 320 models

NEW MODELS (1)
  - Celeris-1 — ELO 1518
 </summary></entry><entry><title>The Aggregate Digest — 2026-07-31</title><id>https://theaggregate.ai/digest/2026-07-31</id><updated>2026-07-31T06:33:57.582950+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;HumanCLAW-Bench - Find&lt;/strong&gt; (Success Rate (%)): leader Gemini-3.1 (64.9), 9 models&lt;br&gt;&lt;span&gt;The Find stage of HumanCLAW-Bench — a frozen off-the-shelf VLM drives a simulated humanoid over 1,218 episodes and must get the target object rendered in its own ego view and acknowledge it; FindSR success rate (%).&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;HumanCLAW-Bench - Navigate&lt;/strong&gt; (Success Rate (%)): leader Gemini-3.1 (42.5), 9 models&lt;br&gt;&lt;span&gt;The Navigate stage of HumanCLAW-Bench — having found the target, the VLM-driven humanoid must walk to it and come to a stop within 20 cm; NavSR success rate (%), gated on the Find stage.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;HumanCLAW-Bench - Interact&lt;/strong&gt; (Success Rate (%)): leader Gemini-3.1 (16.8), 9 models&lt;br&gt;&lt;span&gt;The Interact stage of HumanCLAW-Bench — the full three-stage embodied task: find the target, reach it, and sit with pelvis contact. Gated on the earlier stages, so this is the end-to-end episode success rate (%); no current VLM clears 20%.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MathArena - ARXIVLEAN June&lt;/strong&gt; (Accuracy (%)): leader GPT-5.6 Sol (37.5), 8 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Roboflow Playground Object Detection: 1200.0 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Roboflow Playground Overall: 1200.0 (#33)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Apex Agents: 39.3 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Roboflow Playground Object Detection: 1200.0 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Roboflow Playground Overall: 1200.0 (#34)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI ProgramBench: 62.77 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Time Horizon Index: 5.17 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vending-Bench 2: 5165.04 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vending-Bench 2: 5165.04 (#19)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (5)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;MathArena - ARXIV_FALSE June&lt;/strong&gt;: Claude Opus 5 (Max) (90.74) beat GPT-5.5 (xHigh) by 21.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProfBench&lt;/strong&gt;: Claude Opus 5 (Thinking) (66.2) beat Claude Opus 4.7 (Thinking) by 4.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OckBench&lt;/strong&gt;: opus-5 (xHigh) (95.0) beat opus-4.8 (xHigh) by 3.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Time Horizon Index&lt;/strong&gt;: GPT-5.6 Sol (13.0) beat Claude Opus 4.8 by 1.17&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Tau3 Banking&lt;/strong&gt;: Kimi K3 (Low) (34.02) beat Kimi K3 by 0.62&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-31

=== DAILY ===
NEW BENCHMARKS (4)
  - HumanCLAW-Bench - Find (Success Rate (%)): leader Gemini-3.1 (64.9), 9 models
      The Find stage of HumanCLAW-Bench — a frozen off-the-shelf VLM drives a simulated humanoid over 1,218 episodes and must get the target object re</summary></entry><entry><title>The Aggregate Digest — 2026-07-30</title><id>https://theaggregate.ai/digest/2026-07-30</id><updated>2026-07-30T06:07:50.538944+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (7)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Mystery Game Puzzles&lt;/strong&gt; (Score): leader Claude Opus 5 (Max) (59.0), 20 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Roboflow Playground Overall&lt;/strong&gt; (Arena Elo): leader SAM 3 (1409.0), 62 models&lt;br&gt;&lt;span&gt;Roboflow Playground is a head-to-head vision arena: users submit an image and a task, two models answer anonymously, and the winner is voted on. Overall pools every task type into one Elo rating.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Roboflow Playground Object Detection&lt;/strong&gt; (Arena Elo): leader Gemini 3 Flash (1457.0), 38 models&lt;br&gt;&lt;span&gt;Roboflow Playground arena Elo restricted to object-detection duels — locating and boxing the objects a prompt asks for.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Roboflow Playground Classification&lt;/strong&gt; (Arena Elo): leader Gemini 3 Flash (1224.0), 22 models&lt;br&gt;&lt;span&gt;Roboflow Playground arena Elo restricted to classification duels — assigning an image to the right category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Roboflow Playground OCR&lt;/strong&gt; (Arena Elo): leader Gemini 2.5 Flash (1260.0), 51 models&lt;br&gt;&lt;span&gt;Roboflow Playground arena Elo restricted to OCR duels — reading text out of photographs, screenshots and documents.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Roboflow Playground Captioning&lt;/strong&gt; (Arena Elo): leader Gemini 2.5 Pro (1278.0), 46 models&lt;br&gt;&lt;span&gt;Roboflow Playground arena Elo restricted to captioning duels — describing what an image actually contains.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Roboflow Vision Evals - Visual Understanding&lt;/strong&gt; (Pass Rate (%)): leader Gemini 3.5 Flash (79.1), 77 models&lt;br&gt;&lt;span&gt;Roboflow Vision Evals benchmark for visual QA tasks such as reading text from photos, counting objects, spotting defects, and understanding documents.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (7)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Blueprint-Bench 2: 0.304 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Apex Agents: 37.7 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Blueprint-Bench 2: 0.295 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Blueprint Bench 2: 29.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - ECI: 155.59 (#59)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Proofbench: 70.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Scicode: 58.68 (#3)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Vending Bench 2&lt;/strong&gt;: Claude Opus 5 (Unknown) (11181.87) beat Claude Opus 4.7 (Unknown) by 245.11&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vending-Bench 2&lt;/strong&gt;: Claude Opus 5 (11181.87) beat Claude Opus 4.7 by 245.11&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WebDev Arena&lt;/strong&gt;: Claude Opus 5 (Max) (1711.88) beat Claude Fable 5 (Unknown) by 57.95&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Enigma Eval&lt;/strong&gt;: Claude Fable 5 (High) (39.28) beat GPT-5.4 Pro (xHigh) by 15.46&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-30

=== DAILY ===
NEW BENCHMARKS (7)
  - Epoch AI - Mystery Game Puzzles (Score): leader Claude Opus 5 (Max) (59.0), 20 models
  - Roboflow Playground Overall (Arena Elo): leader SAM 3 (1409.0), 62 models
      Roboflow Playground is a head-to-head vision arena: users </summary></entry><entry><title>The Aggregate Digest — 2026-07-29</title><id>https://theaggregate.ai/digest/2026-07-29</id><updated>2026-07-29T06:21:38.233204+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (13)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;AgentBattler&lt;/strong&gt; (Pooled Score (%)): leader GPT-5.6 Luna (56.21), 3 models&lt;br&gt;&lt;span&gt;AgentBattler pits complete agents rather than bare models: each entrant is one harness and model combination playing open, inspectable terminal and chess challenges, pooling five independently generated engines per row. Scoring uses same-model cross-harness games so model identity stays fixed; we keep the best harness result per underlying model.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PerceptionBench&lt;/strong&gt; (Accuracy (%)): leader GPT-5.6 Sol (59.7), 16 models&lt;br&gt;&lt;span&gt;Moonshot AI benchmark for atomic visual perception in multimodal models: 3,000 verified open-ended questions with short, uniquely determined answers across ten perceptual capabilities, graded by an LLM judge against the reference. Sixteen frontier models are run with unified prompts at their highest reasoning budget, and none reaches 60%.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PerceptionBench - Visual Relation&lt;/strong&gt; (Visual Relation (%)): leader GPT-5.6 Sol (69.7), 16 models&lt;br&gt;&lt;span&gt;PerceptionBench slice scoring whether a model reads the spatial and semantic relations between objects in an image rather than the objects alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PerceptionBench - Counting&lt;/strong&gt; (Counting (%)): leader GPT-5.6 Sol (62.4), 16 models&lt;br&gt;&lt;span&gt;PerceptionBench slice scoring exact enumeration of objects in a scene.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PerceptionBench - Attribute&lt;/strong&gt; (Attribute (%)): leader GPT-5.6 Sol (62.1), 16 models&lt;br&gt;&lt;span&gt;PerceptionBench slice scoring recognition of object attributes such as color, material, shape and state.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PerceptionBench - Depth &amp; 3D&lt;/strong&gt; (Depth &amp; 3D Perception (%)): leader GPT-5.6 Sol (55.5), 16 models&lt;br&gt;&lt;span&gt;PerceptionBench slice scoring depth ordering and three-dimensional spatial perception from a single image.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PerceptionBench - Localization&lt;/strong&gt; (Localization (%)): leader GPT-5.6 Sol (76.7), 16 models&lt;br&gt;&lt;span&gt;PerceptionBench slice scoring where in the image a referenced object actually is.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PerceptionBench - Comparison&lt;/strong&gt; (Comparison (%)): leader GPT-5.6 Sol (67.0), 16 models&lt;br&gt;&lt;span&gt;PerceptionBench slice scoring relative judgements between two or more elements of a scene (larger, closer, brighter, more numerous).&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PerceptionBench - Fine-Grained Recognition&lt;/strong&gt; (Fine-Grained Recognition (%)): leader Seed 2.1 Pro (56.6), 16 models&lt;br&gt;&lt;span&gt;PerceptionBench slice scoring discrimination between visually similar categories that differ only in fine detail.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PerceptionBench - Contextual Integration&lt;/strong&gt; (Contextual Integration (%)): leader Gemini 3.1 Pro (Preview) (61.2), 16 models&lt;br&gt;&lt;span&gt;PerceptionBench slice scoring answers that require combining several parts of the scene rather than reading one region.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PerceptionBench - OCR&lt;/strong&gt; (OCR (%)): leader Seed 2.1 Pro (66.7), 16 models&lt;br&gt;&lt;span&gt;PerceptionBench slice scoring text read directly out of the image.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PerceptionBench - Hallucination&lt;/strong&gt; (Perception Hallucination (%)): leader Gemini 3.5 Flash (50.6), 16 models&lt;br&gt;&lt;span&gt;PerceptionBench slice scoring perception-related hallucination — the share of questions answered without asserting content that is not in the image. The hardest slice on the board: no model clears 51%.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM-SoccerArena&lt;/strong&gt; (Prediction Points): leader GPT-5.5 (168.0), 7 models&lt;br&gt;&lt;span&gt;Real-world football forecasting: models predict scorelines ahead of kickoff and are scored 5 points for the exact score, 2 for the goal difference, 1 for the outcome and 0 otherwise. Each row is a model at its best prompt and lead-time setup across the tournament.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (14)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy: 91.1 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy - Maths: 95.24 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy - Primary: 95.31 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy - Science: 92.35 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy - Secondary: 89.94 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Pedagogy - Social studies: 82.73 (#70)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Kaggle FACTS Parametric: 48.77 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on KernelBench Hub - CUDA: 196.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on KernelBench Hub - Hard: 52.61 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on KernelBench Hub - Mega: 24.29 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpeechMap Compliance: 59.1 (#202)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on TrackingAI IQ Test: 82.35 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on TrackingAI IQ Test (Mensa Norway): 77.14 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on TrackingAI IQ Test (Offline): 81.25 (#7)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (5)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;AI for Education Pedagogy - Technology&lt;/strong&gt;: Claude Opus 5 (91.51) beat Kimi K2.5 by 1.89&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Confirmed Success&lt;/strong&gt;: Claude Opus 5 (Max) (17.56) beat Gemini 3.5 Flash Lite by 1.75&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Praise vs Complaint&lt;/strong&gt;: Claude Opus 5 (Max) (25.63) beat Claude Fable 5 (High) by 1.15&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Debugging&lt;/strong&gt;: Claude Opus 4.8 (1005.1) beat Gemini 3.1 Pro (Preview) by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education SEND&lt;/strong&gt;: Claude Opus 5 (88.99) beat Gemini 3.6 Flash by 0.46&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-29

=== DAILY ===
NEW BENCHMARKS (13)
  - AgentBattler (Pooled Score (%)): leader GPT-5.6 Luna (56.21), 3 models
      AgentBattler pits complete agents rather than bare models: each entrant is one harness and model combination playing open, inspectable terminal and ch</summary></entry><entry><title>The Aggregate Digest — 2026-07-28</title><id>https://theaggregate.ai/digest/2026-07-28</id><updated>2026-07-28T06:45:31.729387+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SpreadsheetBench v2&lt;/strong&gt; (Score (%)): leader Claude Opus 4.6 (34.89), 8 models&lt;br&gt;&lt;span&gt;SpreadsheetBench V2 evaluates model capability on spreadsheets tasks from the linked upstream source with Score as the primary reported metric.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (12)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Kaggle Game Arena Poker (Heads Up): 20.34 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on KernelBench Hub - Hard: 52.61 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LisanBench: 0.1144 (#38)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on TaxCalcBench: 18.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Kaggle FACTS (Google): 52.41 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on VANTAGE-Bench: 69.03 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on VANTAGE-Bench - Event Verification: 75.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on VANTAGE-Bench - Semantic: 76.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on VANTAGE-Bench - Single Object Tracking: 75.02 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on VANTAGE-Bench - Spatial: 77.93 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Mercor APEX: 39.3 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on TrackingAI IQ Test (Offline): 81.25 (#6)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (12)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;FoodTruckBench&lt;/strong&gt;: Claude Opus 5 (75264.0) beat GPT-5.5 by 13856.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Code)&lt;/strong&gt;: Claude Opus 5 (Max) (1725.0) beat Kimi K3 by 43.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KernelBench Hub - CUDA&lt;/strong&gt;: Claude Opus 5 (103.67) beat Claude Fable 5 by 31.01&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench - Single Object Tracking&lt;/strong&gt;: Gemini 3.6 Flash (75.99) beat Gemini 3.1 Pro (Preview) by 11.64&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench - Event Verification&lt;/strong&gt;: Gemini 3.6 Flash (82.0) beat Cosmos-Reason2-32B by 8.42&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench - Semantic&lt;/strong&gt;: Gemini 3.6 Flash (79.41) beat Cosmos-Reason2-32B by 7.47&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OSWorld&lt;/strong&gt;: Intelligence-Indeed Agent (90.19) beat Pointer Agent w/ Opus 4.7 by 6.55&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench&lt;/strong&gt;: Gemini 3.6 Flash (69.52) beat Cosmos3-Super by 6.51&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench - Video QA&lt;/strong&gt;: GPT-5.6 Sol (77.9) beat Gemini 3.1 Pro (Preview) by 6.02&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VANTAGE-Bench - Temporal&lt;/strong&gt;: GPT-5.6 Sol (46.25) beat Gemini 3.1 Pro (Preview) by 5.51&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KernelBench Hub - Mega&lt;/strong&gt;: Claude Opus 5 (24.29) beat Claude Fable 5 by 5.17&lt;/li&gt;&lt;li&gt;&lt;strong&gt;HiL-Bench&lt;/strong&gt;: Claude Opus 5 (57.0) beat Claude Fable 5 by 0.67&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-28

=== DAILY ===
NEW BENCHMARKS (1)
  - SpreadsheetBench v2 (Score (%)): leader Claude Opus 4.6 (34.89), 8 models
      SpreadsheetBench V2 evaluates model capability on spreadsheets tasks from the linked upstream source with Score as the primary reported metric.

NEW</summary></entry><entry><title>The Aggregate Digest — 2026-07-27</title><id>https://theaggregate.ai/digest/2026-07-27</id><updated>2026-07-27T08:01:48.379435+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (8)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;CodeRouterBench&lt;/strong&gt; (Mean Task Score (%)): leader Claude Opus 4.6 (43.83), 8 models&lt;br&gt;&lt;span&gt;Model-routing study dataset (Lance1573): mean per-task score % over the held-out 2,919-task ID test split of code tasks (MBPP-style generation, bug fixing and more) for 8 frontier models.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CodeRouterBench (OOD)&lt;/strong&gt; (Resolve Rate (%)): leader GPT-5.4 (64.2), 8 models&lt;br&gt;&lt;span&gt;CodeRouterBench out-of-distribution split: resolve rate % over 176 unseen repository tasks (featurebench-style bug fixing / feature work) for the same 8 models.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GDPevo&lt;/strong&gt; (base accuracy (%, no-evolution mode)): leader Claude Opus 4.6 (50.4), 6 models&lt;br&gt;&lt;span&gt;Prism-Shadow benchmark of agent self-evolution on 240 real business tasks across 24 groups; base accuracy % (no-evolution mode, mean of 3 runs), each model in its native harness (Codex / Claude Code / Panofy).&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Biomni-Bench (Humanlaya)&lt;/strong&gt; (Score (0-100)): leader Claude Opus 4.7 (73.34), 6 models&lt;br&gt;&lt;span&gt;Humanlaya evaluation of frontier models on Biomni biomedical-agent data-analysis tasks, each model in its native agent harness (Claude Code / Codex / Gemini CLI); mean score 0-100 over 3 runs.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Excel-Bench (Humanlaya)&lt;/strong&gt; (Average Score (%)): leader GPT-5.4 (72.92), 6 models&lt;br&gt;&lt;span&gt;Humanlaya spreadsheet-manipulation benchmark: models solve real Excel tasks; average score %, with OpenAI effort tiers reported as separate rows.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OneMillion-Bench&lt;/strong&gt; (Pass Rate (%)): leader Claude Opus 4.6 (43.5), 36 models&lt;br&gt;&lt;span&gt;Humanlaya web-scale task benchmark: pass rate % over tasks with an estimated economic value per model; Base and Search-augmented rows are listed separately.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldTravel-Bench (Text)&lt;/strong&gt; (Feasibility Rate (%)): leader GPT-5.2 (32.67), 10 models&lt;br&gt;&lt;span&gt;Humanlaya real-world travel-planning feasibility benchmark, text setting: share of generated itineraries that are actually feasible; human performance reference 77.9%.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldTravel-Bench (Multimodal)&lt;/strong&gt; (Feasibility Rate (%)): leader GPT-5.2 (19.33), 7 models&lt;br&gt;&lt;span&gt;WorldTravel-Bench in the multimodal setting (plans grounded in visual materials); feasibility rate %, human performance reference 77.9%.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (7)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on ProphetArena: 0.9424 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Design Arena (3D): 1357.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on MineBench: 2042.52 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Lean AI Formalization Leaderboard: 1.0 (#41)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on MWS Vision Bench: 79.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on MWS Vision Bench: 77.7 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SWE-Milestone: 46.75 (#2)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (16)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - TeleTables&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (79.76) beat OTel-LLM-8.3B-QnA by 17.96&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Document)&lt;/strong&gt;: Claude Opus 5 (High) (1520.0) beat Claude Opus 4.6 by 10.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MWS Vision Bench&lt;/strong&gt;: Claude Fable 5 (79.9) beat Cotype Pro 3 by 6.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - 3GPP&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (87.34) beat OTel-LLM-8.3B-QnA by 5.94&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco LLM Leaderboard&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (90.27) beat OTel-LLM-8.3B-QnA by 4.29&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProgramBench Almost&lt;/strong&gt;: Claude Opus 4.8 (xHigh) (16.5) beat GPT-5.5 (xHigh) by 3.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gert Labs Rankings&lt;/strong&gt;: Claude Opus 5 (75.77) beat Claude Fable 5 by 2.99&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - TeleMath&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (89.8) beat OTel-LLM-8.3B-QnA by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PutnamBench&lt;/strong&gt;: Humanfia (w/ GPT 5.5) (670.0) beat Aleph Prover (Logical Intelligence) by 2.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - srsRAN-Bench&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (91.54) beat OTel-LLM-8.3B-QnA by 1.86&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - TeleLogs&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (98.15) beat OTel-LLM-8.3B-QnA by 1.85&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vector Eval - MATH&lt;/strong&gt;: Qwen3 Coder Next (97.82) beat O3 Mini by 0.91&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSMA Open-Telco - TeleQnA&lt;/strong&gt;: OTel-2.0-LLM-31B-IT (91.7) beat OTel-LLM-8.3B-QnA by 0.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vector Eval - InterCode-CTF&lt;/strong&gt;: Qwen3 Coder Next (85.9) beat Claude 3.5 Sonnet by 0.33&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vector Eval - GPQA-D&lt;/strong&gt;: Qwen3 Coder Next (75.63) beat O1 by 0.12&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GBA Eval&lt;/strong&gt;: Claude Opus 5 (0.796) beat Claude Fable 5 by 0.05&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-27

=== DAILY ===
NEW BENCHMARKS (8)
  - CodeRouterBench (Mean Task Score (%)): leader Claude Opus 4.6 (43.83), 8 models
      Model-routing study dataset (Lance1573): mean per-task score % over the held-out 2,919-task ID test split of code tasks (MBPP-style generation</summary></entry><entry><title>The Aggregate Digest — 2026-07-26</title><id>https://theaggregate.ai/digest/2026-07-26</id><updated>2026-07-26T06:48:19.646411+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SpatialGen-Bench (Text Answering)&lt;/strong&gt; (Overall Accuracy (%)): leader Claude Fable 5 (81.26), 25 models&lt;br&gt;&lt;span&gt;Spatial cognition benchmark from the ProVisE project (ZJU-OmniAI, &amp;quot;Show, Don\&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Benchmarks.bio - BioSecBench-Surveillance: 59.8 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Benchmarks.bio - EpiBench: 35.22 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Benchmarks.bio - VariantBench: 49.72 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Design Arena (UI Components): 1387.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Design Arena (Website): 1331.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on FoodTruckBench: 53229.0 (#2)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Multi-turn Debate (Lechmazur)&lt;/strong&gt;: Claude Opus 5 (High) (1763.4) beat Claude Fable 5 (High) by 6.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;NYT Connections Older Models&lt;/strong&gt;: ByteDance Seed2.1 Pro (97.8) beat GLM-5.2 (Thinking, Max) by 5.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EQ-Bench Longform Writing&lt;/strong&gt;: Claude Opus 5 (86.3) beat Claude Fable 5 by 3.3&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Weekly&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SpatialGen-Bench (Text Answering)&lt;/strong&gt; (Overall Accuracy (%)): leader Claude Fable 5 (81.26), 25 models&lt;br&gt;&lt;span&gt;Spatial cognition benchmark from the ProVisE project (ZJU-OmniAI, &amp;quot;Show, Don\&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (138)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; — ELO 3263, #1&lt;ul&gt;&lt;li&gt;BenchLM: 62.8 (#41/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; — ELO 3073, #2&lt;ul&gt;&lt;li&gt;HiL-Bench: 56.33 (#1/14)&lt;/li&gt;&lt;li&gt;Vals AI Public Benefits Bench: 70.43 (#2/23)&lt;/li&gt;&lt;li&gt;CHI-Bench: 24.0 (#6/23)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; — ELO 2963, #3&lt;ul&gt;&lt;li&gt;DeepSWE: 73.6 (#1/22)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - scBench-Long: 41.27 (#1/19)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - BioSecBench-Surveillance: 59.8 (#1/16)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - VariantBench: 49.72 (#1/13)&lt;/li&gt;&lt;li&gt;Vellum - Humanity's Last Exam: 64.7 (#1/31)&lt;/li&gt;&lt;li&gt;EQ-Bench Longform Writing: 86.3 (#1/124)&lt;/li&gt;&lt;li&gt;LLM Stats (GDPval-AA): 1861.0 (#1/42)&lt;/li&gt;&lt;li&gt;Vals AI CorpFin v2: 73.19 (#1/126)&lt;/li&gt;&lt;li&gt;Vals AI Finance Agent v2: 58.63 (#1/40)&lt;/li&gt;&lt;li&gt;Vals AI MortgageTax: 72.06 (#1/90)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro (xHigh)&lt;/strong&gt; — ELO 2838, #4&lt;ul&gt;&lt;li&gt;BenchLM: 60.0 (#47/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; — ELO 2723, #5&lt;ul&gt;&lt;li&gt;Vellum - HumanEval: 96.2 (#1/47)&lt;/li&gt;&lt;li&gt;Vellum - ARC-AGI-2: 92.5 (#1/15)&lt;/li&gt;&lt;li&gt;YapBench: 18.5 (#1/108)&lt;/li&gt;&lt;li&gt;Epoch AI - Vending Bench 2: 9619.37 (#2/54)&lt;/li&gt;&lt;li&gt;MyPCBench: 55.4 (#2/8)&lt;/li&gt;&lt;li&gt;FoodTruckBench: 53229.0 (#2/10)&lt;/li&gt;&lt;li&gt;Icelandic LLM - ARC-Challenge-IS: 95.22 (#2/92)&lt;/li&gt;&lt;li&gt;Vellum - GPQA: 94.6 (#3/68)&lt;/li&gt;&lt;li&gt;CHI-Bench: 25.3 (#4/23)&lt;/li&gt;&lt;li&gt;BenchLM: 81.5 (#4/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; — ELO 2669, #6&lt;ul&gt;&lt;li&gt;Mercor APEX: 42.5 (#3/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; — ELO 2663, #7&lt;ul&gt;&lt;li&gt;Design Arena (Website): 1375.0 (#1/159)&lt;/li&gt;&lt;li&gt;Design Arena (UI Components): 1408.0 (#1/139)&lt;/li&gt;&lt;li&gt;OpenClawProBench: 81.6 (#1/68)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 14.0 (#3/38)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 20.3 (#3/38)&lt;/li&gt;&lt;li&gt;Agents' Last Exam: 28.3 (#3/21)&lt;/li&gt;&lt;li&gt;Creative Writing (Lechmazur): 2.9 (#3/39)&lt;/li&gt;&lt;li&gt;Multi-turn Debate (Lechmazur): 1734.3 (#3/42)&lt;/li&gt;&lt;li&gt;Vellum - Humanity's Last Exam: 56.0 (#5/31)&lt;/li&gt;&lt;li&gt;BenchLM: 80.0 (#5/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5&lt;/strong&gt; — ELO 2575, #8&lt;ul&gt;&lt;li&gt;Mercor APEX: 38.5 (#8/50)&lt;/li&gt;&lt;li&gt;OckBench: 26.0 (#45/49)&lt;/li&gt;&lt;li&gt;ForecastBench: 64.6 (#65/236)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.6&lt;/strong&gt; — ELO 2510, #10&lt;ul&gt;&lt;li&gt;OckBench: 84.5 (#8/49)&lt;/li&gt;&lt;li&gt;Mercor APEX: 32.4 (#15/50)&lt;/li&gt;&lt;li&gt;BenchLM: 67.8 (#19/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Pro (Preview)&lt;/strong&gt; — ELO 2495, #11&lt;ul&gt;&lt;li&gt;BridgeBench Debugging: 1004.1 (#1/2)&lt;/li&gt;&lt;li&gt;ProphetArena: 0.9545 (#5/50)&lt;/li&gt;&lt;li&gt;Mercor APEX: 33.5 (#13/50)&lt;/li&gt;&lt;li&gt;Agents' Last Exam: 15.8 (#13/21)&lt;/li&gt;&lt;li&gt;OckBench: 76.0 (#19/49)&lt;/li&gt;&lt;li&gt;GAIA: 55.48 (#556/3460)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; — ELO 2473, #12&lt;ul&gt;&lt;li&gt;Gert Labs Rankings: 70.27 (#3/90)&lt;/li&gt;&lt;li&gt;BenchLM: 76.6 (#7/200)&lt;/li&gt;&lt;li&gt;Vals AI SkillsBench: 59.19 (#8/20)&lt;/li&gt;&lt;li&gt;GBA Eval: 0.0792 (#12/22)&lt;/li&gt;&lt;li&gt;GDP.pdf: 15.0 (#14/24)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 15.1 (#19/73)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1140.0 (#44/303)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 727.0 (#83/248)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.7&lt;/strong&gt; — ELO 2463, #13&lt;ul&gt;&lt;li&gt;Mercor APEX: 33.9 (#12/50)&lt;/li&gt;&lt;li&gt;BenchLM: 71.6 (#14/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; — ELO 2438, #14&lt;ul&gt;&lt;li&gt;YapBench: 124.7 (#32/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash&lt;/strong&gt; — ELO 2435, #15&lt;ul&gt;&lt;li&gt;ProphetArena: 0.9509 (#12/50)&lt;/li&gt;&lt;li&gt;TaxCalcBench: 4.0 (#12/13)&lt;/li&gt;&lt;li&gt;ForecastBench: 64.4 (#73/236)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.5&lt;/strong&gt; — ELO 2432, #16&lt;ul&gt;&lt;li&gt;Vals AI SkillsBench: 66.03 (#1/20)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test: 98.04 (#1/35)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test (Mensa Norway): 100.0 (#1/35)&lt;/li&gt;&lt;li&gt;FrontierSWE: 78.0 (#2/15)&lt;/li&gt;&lt;li&gt;GBA Eval: 0.6541 (#3/22)&lt;/li&gt;&lt;li&gt;FoodTruckBench: 34586.0 (#4/10)&lt;/li&gt;&lt;li&gt;Kaggle FACTS Grounding: 74.52 (#5/45)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test (Vision): 78.43 (#6/23)&lt;/li&gt;&lt;li&gt;BenchLM: 75.5 (#8/200)&lt;/li&gt;&lt;li&gt;Lean AI Formalization Leaderboard: 3.0 (#15/47)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 5&lt;/strong&gt; — ELO 2414, #17&lt;ul&gt;&lt;li&gt;GBA Eval: 0.6526 (#4/22)&lt;/li&gt;&lt;li&gt;Mercor APEX: 32.5 (#14/50)&lt;/li&gt;&lt;li&gt;Vals AI SkillsBench: 46.48 (#17/20)&lt;/li&gt;&lt;li&gt;BenchLM: 64.7 (#32/200)&lt;/li&gt;&lt;li&gt;YapBench: 507.7 (#96/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Terra&lt;/strong&gt; — ELO 2407, #18&lt;ul&gt;&lt;li&gt;Agents' Last Exam: 28.0 (#4/21)&lt;/li&gt;&lt;li&gt;Vals AI SkillsBench: 60.65 (#4/20)&lt;/li&gt;&lt;li&gt;Epoch AI - Vending Bench 2: 7343.21 (#6/54)&lt;/li&gt;&lt;li&gt;RuneBench: 5934.0 (#6/41)&lt;/li&gt;&lt;li&gt;GDP.pdf: 24.7 (#7/24)&lt;/li&gt;&lt;li&gt;Icelandic LLM - ARC-Challenge-IS: 94.8 (#9/92)&lt;/li&gt;&lt;li&gt;Kaggle FACTS Grounding: 71.21 (#9/45)&lt;/li&gt;&lt;li&gt;Kaggle FACTS Parametric: 55.04 (#10/33)&lt;/li&gt;&lt;li&gt;Vellum - GPQA: 92.9 (#12/68)&lt;/li&gt;&lt;li&gt;BenchLM: 72.0 (#12/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.3 Codex&lt;/strong&gt; — ELO 2389, #20&lt;ul&gt;&lt;li&gt;Mercor APEX: 31.8 (#16/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Pro&lt;/strong&gt; — ELO 2384, #21&lt;ul&gt;&lt;li&gt;Mercor APEX: 31.5 (#17/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5&lt;/strong&gt; — ELO 2379, #22&lt;ul&gt;&lt;li&gt;Mercor APEX: 18.3 (#27/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.6 Flash&lt;/strong&gt; — ELO 2379, #23&lt;ul&gt;&lt;li&gt;Kaggle FACTS Multimodal: 47.21 (#1/32)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Maths: 95.24 (#1/226)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 88.53 (#1/218)&lt;/li&gt;&lt;li&gt;RuneBench: 7454.0 (#3/41)&lt;/li&gt;&lt;li&gt;LLM Stats (OSWorld-Verified): 83.0 (#3/21)&lt;/li&gt;&lt;li&gt;Vals AI GPQA: 93.43 (#3/126)&lt;/li&gt;&lt;li&gt;Design Arena (Data Viz): 1343.0 (#4/142)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1800.0 (#4/303)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 1761.0 (#4/248)&lt;/li&gt;&lt;li&gt;Kaggle FACTS Parametric: 73.35 (#4/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4&lt;/strong&gt; — ELO 2353, #24&lt;ul&gt;&lt;li&gt;Mercor APEX: 36.0 (#9/50)&lt;/li&gt;&lt;li&gt;OckBench: 23.5 (#47/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Luna&lt;/strong&gt; — ELO 2350, #25&lt;ul&gt;&lt;li&gt;Agents' Last Exam: 29.6 (#2/21)&lt;/li&gt;&lt;li&gt;MyPCBench: 55.4 (#3/8)&lt;/li&gt;&lt;li&gt;Vellum - HumanEval: 93.0 (#4/47)&lt;/li&gt;&lt;li&gt;YapBench: 27.8 (#4/108)&lt;/li&gt;&lt;li&gt;Vals AI SkillsBench: 60.45 (#5/20)&lt;/li&gt;&lt;li&gt;GDP.pdf: 22.7 (#9/24)&lt;/li&gt;&lt;li&gt;Icelandic LLM - WikiQA-IS: 46.87 (#13/92)&lt;/li&gt;&lt;li&gt;Vellum - GPQA: 92.3 (#14/68)&lt;/li&gt;&lt;li&gt;Icelandic LLM - GED: 74.5 (#14/92)&lt;/li&gt;&lt;li&gt;Icelandic LLM - Inflection: 94.54 (#15/92)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.2&lt;/strong&gt; — ELO 2340, #26&lt;ul&gt;&lt;li&gt;HiL-Bench: 43.67 (#2/14)&lt;/li&gt;&lt;li&gt;SEAL - MCP Atlas: 77.8 (#10/28)&lt;/li&gt;&lt;li&gt;Mercor APEX: 35.6 (#10/50)&lt;/li&gt;&lt;li&gt;YapBench: 76.5 (#16/108)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 81.19 (#38/218)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Science: 90.16 (#44/226)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Secondary: 85.85 (#53/226)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy: 85.87 (#54/226)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Maths: 85.71 (#56/226)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Social studies: 83.64 (#63/226)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2 Pro&lt;/strong&gt; — ELO 2337, #27&lt;ul&gt;&lt;li&gt;BenchLM: 66.4 (#25/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2 Codex&lt;/strong&gt; — ELO 2294, #30&lt;ul&gt;&lt;li&gt;Mercor APEX: 27.6 (#18/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; — ELO 2279, #31&lt;ul&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 19.01 (#5/38)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 11.6 (#5/38)&lt;/li&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.4 (#5/38)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 7.19 (#14/38)&lt;/li&gt;&lt;li&gt;Riemann-bench: 15.2 (#15/24)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Technology: 86.79 (#19/226)&lt;/li&gt;&lt;li&gt;Agent Arena: 6.41 (#20/38)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Social studies: 87.27 (#20/226)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 83.03 (#21/218)&lt;/li&gt;&lt;li&gt;BenchLM: 66.9 (#22/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Plus&lt;/strong&gt; — ELO 2269, #32&lt;ul&gt;&lt;li&gt;YapBench: 85.7 (#20/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Flash (Preview)&lt;/strong&gt; — ELO 2265, #33&lt;ul&gt;&lt;li&gt;OckBench: 44.5 (#35/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Flash&lt;/strong&gt; — ELO 2258, #35&lt;ul&gt;&lt;li&gt;DeepSWE: 48.6 (#17/22)&lt;/li&gt;&lt;li&gt;Mercor APEX: 24.0 (#20/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2&lt;/strong&gt; — ELO 2252, #36&lt;ul&gt;&lt;li&gt;Mercor APEX: 41.8 (#5/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.5&lt;/strong&gt; — ELO 2244, #38&lt;ul&gt;&lt;li&gt;Mercor APEX: 20.7 (#23/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M3&lt;/strong&gt; — ELO 2238, #40&lt;ul&gt;&lt;li&gt;Senior SWE-Bench: 13.8 (#9/10)&lt;/li&gt;&lt;li&gt;Multi-turn Debate (Lechmazur): 1531.1 (#16/42)&lt;/li&gt;&lt;li&gt;YapBench: 360.0 (#80/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hy3&lt;/strong&gt; — ELO 2231, #42&lt;ul&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.89 (#11/38)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 7.1 (#18/38)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Code): 1517.0 (#19/101)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 4.65 (#24/38)&lt;/li&gt;&lt;li&gt;YapBench: 116.7 (#29/108)&lt;/li&gt;&lt;li&gt;Agent Arena: 2.23 (#30/38)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 2.87 (#34/38)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 2.56 (#36/38)&lt;/li&gt;&lt;li&gt;BenchLM: 54.6 (#91/200)&lt;/li&gt;&lt;li&gt;Wolfram LLM Benchmarking Project: 54.8 (#103/520)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 Max Preview&lt;/strong&gt; — ELO 2228, #43&lt;ul&gt;&lt;li&gt;BenchLM: 59.3 (#59/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Codex&lt;/strong&gt; — ELO 2211, #44&lt;ul&gt;&lt;li&gt;Mercor APEX: 20.1 (#25/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5-Pro&lt;/strong&gt; — ELO 2205, #45&lt;ul&gt;&lt;li&gt;BenchLM: 69.4 (#17/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro&lt;/strong&gt; — ELO 2202, #47&lt;ul&gt;&lt;li&gt;YapBench: 151.3 (#35/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3&lt;/strong&gt; — ELO 2188, #49&lt;ul&gt;&lt;li&gt;Mercor APEX: 17.2 (#29/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.7 Code&lt;/strong&gt; — ELO 2175, #50&lt;ul&gt;&lt;li&gt;BridgeBench Debugging: 995.9 (#2/2)&lt;/li&gt;&lt;li&gt;YapBench: 72.0 (#14/108)&lt;/li&gt;&lt;li&gt;BenchLM: 54.0 (#96/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Codex&lt;/strong&gt; — ELO 2171, #53&lt;ul&gt;&lt;li&gt;Mercor APEX: 20.7 (#24/50)&lt;/li&gt;&lt;li&gt;BenchLM: 51.7 (#109/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.6&lt;/strong&gt; — ELO 2164, #54&lt;ul&gt;&lt;li&gt;ProphetArena: 0.9407 (#17/50)&lt;/li&gt;&lt;li&gt;Mercor APEX: 23.7 (#21/50)&lt;/li&gt;&lt;li&gt;OckBench: 58.5 (#29/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash&lt;/strong&gt; — ELO 2158, #55&lt;ul&gt;&lt;li&gt;RuneBench: 3492.0 (#9/41)&lt;/li&gt;&lt;li&gt;YapBench: 202.2 (#43/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.6&lt;/strong&gt; — ELO 2146, #57&lt;ul&gt;&lt;li&gt;HiL-Bench: 18.67 (#11/14)&lt;/li&gt;&lt;li&gt;OckBench: 75.0 (#21/49)&lt;/li&gt;&lt;li&gt;YapBench: 238.2 (#48/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1&lt;/strong&gt; — ELO 2135, #60&lt;ul&gt;&lt;li&gt;Mercor APEX: 17.5 (#28/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 Plus&lt;/strong&gt; — ELO 2129, #63&lt;ul&gt;&lt;li&gt;BenchLM: 46.3 (#148/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.5&lt;/strong&gt; — ELO 2120, #67&lt;ul&gt;&lt;li&gt;OckBench: 72.5 (#23/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1&lt;/strong&gt; — ELO 2120, #68&lt;ul&gt;&lt;li&gt;Mercor APEX: 1.1 (#50/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.1&lt;/strong&gt; — ELO 2102, #72&lt;ul&gt;&lt;li&gt;OckBench: 63.5 (#27/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Max&lt;/strong&gt; — ELO 2100, #73&lt;ul&gt;&lt;li&gt;BenchLM: 47.2 (#139/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.3&lt;/strong&gt; — ELO 2097, #74&lt;ul&gt;&lt;li&gt;BenchLM: 64.2 (#35/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Pro&lt;/strong&gt; — ELO 2097, #75&lt;ul&gt;&lt;li&gt;BenchLM: 66.8 (#23/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Preview&lt;/strong&gt; — ELO 2092, #77&lt;ul&gt;&lt;li&gt;BenchLM: 48.3 (#132/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5V Turbo&lt;/strong&gt; — ELO 2092, #78&lt;ul&gt;&lt;li&gt;BenchLM: 62.4 (#42/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 397B A17B&lt;/strong&gt; — ELO 2089, #80&lt;ul&gt;&lt;li&gt;OckBench: 67.5 (#24/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5-Turbo&lt;/strong&gt; — ELO 2082, #83&lt;ul&gt;&lt;li&gt;BenchLM: 66.0 (#28/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash Lite&lt;/strong&gt; — ELO 2076, #84&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 1518.0 (#9/248)&lt;/li&gt;&lt;li&gt;Vals AI CyberBench: 72.32 (#9/20)&lt;/li&gt;&lt;li&gt;Kaggle FACTS Grounding: 71.2 (#10/45)&lt;/li&gt;&lt;li&gt;LLM Stats (OSWorld-Verified): 74.0 (#11/21)&lt;/li&gt;&lt;li&gt;Vals AI MortgageTax: 68.68 (#11/90)&lt;/li&gt;&lt;li&gt;Kaggle FACTS Parametric: 43.36 (#13/33)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 54.0 (#15/15)&lt;/li&gt;&lt;li&gt;Vals AI IOI: 26.17 (#15/60)&lt;/li&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 21.3 (#18/21)&lt;/li&gt;&lt;li&gt;RuneBench: 2254.0 (#19/41)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5&lt;/strong&gt; — ELO 2069, #85&lt;ul&gt;&lt;li&gt;OckBench: 59.5 (#28/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash Lite&lt;/strong&gt; — ELO 2058, #88&lt;ul&gt;&lt;li&gt;Mercor APEX: 13.0 (#35/50)&lt;/li&gt;&lt;li&gt;OckBench: 26.5 (#44/49)&lt;/li&gt;&lt;li&gt;ForecastBench: 61.5 (#139/236)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Step 3.7 Flash&lt;/strong&gt; — ELO 2047, #90&lt;ul&gt;&lt;li&gt;BenchLM: 49.9 (#121/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Mini&lt;/strong&gt; — ELO 2031, #91&lt;ul&gt;&lt;li&gt;BenchLM: 43.0 (#165/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Step 3.5 Flash&lt;/strong&gt; — ELO 2031, #92&lt;ul&gt;&lt;li&gt;BenchLM: 54.2 (#94/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 31B (IT)&lt;/strong&gt; — ELO 2020, #95&lt;ul&gt;&lt;li&gt;OckBench: 41.5 (#39/49)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 141.86 (#238/427)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.1 Fast&lt;/strong&gt; — ELO 2019, #97&lt;ul&gt;&lt;li&gt;MineBench: 822.37 (#48/53)&lt;/li&gt;&lt;li&gt;BenchLM: 50.5 (#114/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LongCat 2.0&lt;/strong&gt; — ELO 2016, #98&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 773.0 (#103/303)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 573.0 (#124/248)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.20&lt;/strong&gt; — ELO 2002, #103&lt;ul&gt;&lt;li&gt;ProphetArena: 0.9464 (#14/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5&lt;/strong&gt; — ELO 2000, #104&lt;ul&gt;&lt;li&gt;BenchLM: 57.9 (#72/200)&lt;/li&gt;&lt;li&gt;YapBench: 395.7 (#85/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hy3-preview&lt;/strong&gt; — ELO 1989, #109&lt;ul&gt;&lt;li&gt;BenchLM: 42.7 (#167/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 27B&lt;/strong&gt; — ELO 1988, #110&lt;ul&gt;&lt;li&gt;OckBench: 52.0 (#32/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Mini&lt;/strong&gt; — ELO 1987, #111&lt;ul&gt;&lt;li&gt;Mercor APEX: 24.6 (#19/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.7&lt;/strong&gt; — ELO 1981, #116&lt;ul&gt;&lt;li&gt;OckBench: 66.88 (#25/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 122B A10B&lt;/strong&gt; — ELO 1950, #127&lt;ul&gt;&lt;li&gt;OckBench: 53.5 (#31/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.1&lt;/strong&gt; — ELO 1938, #130&lt;ul&gt;&lt;li&gt;BenchLM: 52.8 (#104/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mercury 2&lt;/strong&gt; — ELO 1933, #136&lt;ul&gt;&lt;li&gt;Tau3 Banking: 9.9 (#94/179)&lt;/li&gt;&lt;li&gt;BenchLM: 48.0 (#133/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.6&lt;/strong&gt; — ELO 1929, #140&lt;ul&gt;&lt;li&gt;BenchLM: 54.3 (#93/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Omni&lt;/strong&gt; — ELO 1918, #148&lt;ul&gt;&lt;li&gt;BenchLM: 62.2 (#43/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.5&lt;/strong&gt; — ELO 1908, #155&lt;ul&gt;&lt;li&gt;BenchLM: 56.8 (#78/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Command A+&lt;/strong&gt; — ELO 1897, #161&lt;ul&gt;&lt;li&gt;BenchLM: 46.6 (#146/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.5&lt;/strong&gt; — ELO 1894, #164&lt;ul&gt;&lt;li&gt;OckBench: 44.5 (#36/49)&lt;/li&gt;&lt;li&gt;BenchLM: 58.6 (#66/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EXAONE 4.5 33B&lt;/strong&gt; — ELO 1890, #167&lt;ul&gt;&lt;li&gt;Tau3 Banking: 11.13 (#87/179)&lt;/li&gt;&lt;li&gt;AA GDPval: 680.45 (#112/175)&lt;/li&gt;&lt;li&gt;GDPval-AA: 680.0 (#116/180)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;qwen3.5-flash&lt;/strong&gt; — ELO 1869, #183&lt;ul&gt;&lt;li&gt;BenchLM: 47.0 (#141/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;nemotron-3-super-120B-a12B&lt;/strong&gt; — ELO 1865, #186&lt;ul&gt;&lt;li&gt;SEA-HELM: 47.94 (#30/44)&lt;/li&gt;&lt;li&gt;BenchLM: 50.2 (#119/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 31B&lt;/strong&gt; — ELO 1860, #189&lt;ul&gt;&lt;li&gt;RuneBench: 633.0 (#34/41)&lt;/li&gt;&lt;li&gt;BenchLM: 60.2 (#46/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 35B A3B&lt;/strong&gt; — ELO 1854, #194&lt;ul&gt;&lt;li&gt;OckBench: 47.5 (#33/49)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 143.31 (#209/427)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1&lt;/strong&gt; — ELO 1844, #199&lt;ul&gt;&lt;li&gt;BenchLM: 50.9 (#112/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Nano&lt;/strong&gt; — ELO 1838, #201&lt;ul&gt;&lt;li&gt;BenchLM: 66.0 (#27/200)&lt;/li&gt;&lt;li&gt;Mercor APEX: 16.9 (#31/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Sarvam 105B&lt;/strong&gt; — ELO 1829, #204&lt;ul&gt;&lt;li&gt;BenchLM: 42.1 (#169/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM 4.5 Air&lt;/strong&gt; — ELO 1820, #210&lt;ul&gt;&lt;li&gt;BenchLM: 46.9 (#144/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Haiku 4.5&lt;/strong&gt; — ELO 1819, #212&lt;ul&gt;&lt;li&gt;ParseBench: 45.17 (#39/50)&lt;/li&gt;&lt;li&gt;Mercor APEX: 8.9 (#39/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-OSS-120B&lt;/strong&gt; — ELO 1815, #215&lt;ul&gt;&lt;li&gt;RuneBench: 463.0 (#37/41)&lt;/li&gt;&lt;li&gt;Mercor APEX: 4.7 (#44/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 3&lt;/strong&gt; — ELO 1813, #216&lt;ul&gt;&lt;li&gt;BenchLM: 49.6 (#122/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok Code Fast 1&lt;/strong&gt; — ELO 1810, #219&lt;ul&gt;&lt;li&gt;BenchLM: 37.8 (#193/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 35B A3B&lt;/strong&gt; — ELO 1800, #220&lt;ul&gt;&lt;li&gt;OckBench: 46.0 (#34/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 405B&lt;/strong&gt; — ELO 1796, #223&lt;ul&gt;&lt;li&gt;BenchLM: 50.9 (#111/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Nano&lt;/strong&gt; — ELO 1763, #240&lt;ul&gt;&lt;li&gt;BenchLM: 45.5 (#150/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small 4&lt;/strong&gt; — ELO 1748, #256&lt;ul&gt;&lt;li&gt;YapBench: 320.2 (#67/108)&lt;/li&gt;&lt;li&gt;BenchLM: 45.3 (#151/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.7 Flash&lt;/strong&gt; — ELO 1725, #267&lt;ul&gt;&lt;li&gt;BenchLM: 50.4 (#116/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;trinity-large-preview&lt;/strong&gt; — ELO 1721, #269&lt;ul&gt;&lt;li&gt;BenchLM: 55.2 (#89/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 9B&lt;/strong&gt; — ELO 1718, #271&lt;ul&gt;&lt;li&gt;OckBench: 21.5 (#48/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 2 (Jul)&lt;/strong&gt; — ELO 1705, #280&lt;ul&gt;&lt;li&gt;BenchLM: 40.9 (#176/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral 3 14B&lt;/strong&gt; — ELO 1686, #300&lt;ul&gt;&lt;li&gt;BenchLM: 33.7 (#200/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Medium 3&lt;/strong&gt; — ELO 1685, #302&lt;ul&gt;&lt;li&gt;BenchLM: 42.3 (#168/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Pro&lt;/strong&gt; — ELO 1679, #304&lt;ul&gt;&lt;li&gt;BenchLM: 35.0 (#198/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o Mini&lt;/strong&gt; — ELO 1668, #310&lt;ul&gt;&lt;li&gt;BenchLM: 37.1 (#196/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 12B&lt;/strong&gt; — ELO 1651, #325&lt;ul&gt;&lt;li&gt;SEA-HELM: 65.23 (#9/44)&lt;/li&gt;&lt;li&gt;BenchLM: 46.3 (#149/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 72B&lt;/strong&gt; — ELO 1648, #328&lt;ul&gt;&lt;li&gt;BenchLM: 51.4 (#110/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 26B A4B&lt;/strong&gt; — ELO 1608, #357&lt;ul&gt;&lt;li&gt;BenchLM: 57.1 (#77/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral-3-3B-Reasoning-2512&lt;/strong&gt; — ELO 1602, #360&lt;ul&gt;&lt;li&gt;BenchLM: 38.8 (#190/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 27B&lt;/strong&gt; — ELO 1596, #363&lt;ul&gt;&lt;li&gt;BenchLM: 40.9 (#177/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3 70B&lt;/strong&gt; — ELO 1575, #382&lt;ul&gt;&lt;li&gt;BenchLM: 50.0 (#120/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 Coder 32B Instruct&lt;/strong&gt; — ELO 1572, #386&lt;ul&gt;&lt;li&gt;BenchLM: 34.0 (#199/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1 Distill Qwen 32B&lt;/strong&gt; — ELO 1564, #394&lt;ul&gt;&lt;li&gt;BenchLM: 41.7 (#173/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Sarvam 30B&lt;/strong&gt; — ELO 1545, #401&lt;ul&gt;&lt;li&gt;BenchLM: 39.9 (#182/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral 3 3B&lt;/strong&gt; — ELO 1541, #405&lt;ul&gt;&lt;li&gt;AA MATH-500: 80.04 (#109/206)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mixtral 8x22B Instruct (v0.1)&lt;/strong&gt; — ELO 1538, #408&lt;ul&gt;&lt;li&gt;BenchLM: 47.8 (#135/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ling-2.6-flash&lt;/strong&gt; — ELO 1518, #420&lt;ul&gt;&lt;li&gt;BenchLM: 43.0 (#166/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral-3-14B-Reasoning-2512&lt;/strong&gt; — ELO 1506, #431&lt;ul&gt;&lt;li&gt;BenchLM: 48.6 (#131/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Exaone 4.0 1.2B&lt;/strong&gt; — ELO 1502, #433&lt;ul&gt;&lt;li&gt;BenchLM: 38.2 (#192/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Opus&lt;/strong&gt; — ELO 1470, #453&lt;ul&gt;&lt;li&gt;BenchLM: 40.4 (#180/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Granite 4.0 H 1B&lt;/strong&gt; — ELO 1414, #490&lt;ul&gt;&lt;li&gt;AA MATH-500: 52.16 (#172/206)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LFM2 2.6B&lt;/strong&gt; — ELO 1373, #521&lt;ul&gt;&lt;li&gt;AA MATH-500: 75.28 (#126/206)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E4B&lt;/strong&gt; — ELO 1343, #544&lt;ul&gt;&lt;li&gt;SEA-HELM: 62.57 (#14/44)&lt;/li&gt;&lt;li&gt;BenchLM: 42.1 (#170/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;gemma-4-E2B-it&lt;/strong&gt; — ELO 1327, #550&lt;ul&gt;&lt;li&gt;VANTAGE-Bench: 21.56 (#14/14)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Spatial: 28.56 (#14/14)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Temporal: 9.16 (#14/14)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Semantic: 36.92 (#14/14)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Video QA: 46.19 (#14/14)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Event Verification: 27.65 (#14/14)&lt;/li&gt;&lt;li&gt;VANTAGE-Bench - Single Object Tracking: 11.58 (#14/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 0.8B&lt;/strong&gt; — ELO 1313, #561&lt;ul&gt;&lt;li&gt;LIBRA - ruSciPassageCount *: 17.79 (#7/13)&lt;/li&gt;&lt;li&gt;LIBRA - ruBABILongQA2: 44.67 (#7/13)&lt;/li&gt;&lt;li&gt;LIBRA - MatreshkaNames *: 56.05 (#8/13)&lt;/li&gt;&lt;li&gt;LIBRA - ru2WikiMultihopQA *: 46.0 (#8/13)&lt;/li&gt;&lt;li&gt;LIBRA - LibrusecMHQA *: 35.21 (#8/13)&lt;/li&gt;&lt;li&gt;LIBRA - ruBABILongQA1: 55.57 (#8/13)&lt;/li&gt;&lt;li&gt;LIBRA - ruBABILongQA4: 49.0 (#8/13)&lt;/li&gt;&lt;li&gt;LIBRA - ruSciAbstractRetrieval: 56.26 (#9/13)&lt;/li&gt;&lt;li&gt;LIBRA - ruSciFi: 41.83 (#9/13)&lt;/li&gt;&lt;li&gt;LIBRA - ruBABILongQA3 *: 26.5 (#9/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral-7B-v0.3&lt;/strong&gt; — ELO 1222, #601&lt;ul&gt;&lt;li&gt;BenchLM: 39.1 (#186/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Granite 4.0 H 350M&lt;/strong&gt; — ELO 1145, #634&lt;ul&gt;&lt;li&gt;BenchLM: 37.5 (#195/200)&lt;/li&gt;&lt;li&gt;AA MATH-500: 11.64 (#204/206)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Granite 4.0 350M&lt;/strong&gt; — ELO 1120, #641&lt;ul&gt;&lt;li&gt;BenchLM: 37.5 (#194/200)&lt;/li&gt;&lt;li&gt;AA MATH-500: 14.0 (#202/206)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E2B&lt;/strong&gt; — ELO 1111, #643&lt;ul&gt;&lt;li&gt;SEA-HELM: 47.21 (#32/44)&lt;/li&gt;&lt;li&gt;BenchLM: 41.1 (#175/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LFM2.5-1.2B Instruct&lt;/strong&gt; — ELO 1110, #644&lt;ul&gt;&lt;li&gt;AA MATH-500: 71.68 (#137/206)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Pro Sol&lt;/strong&gt; — ELO 2802&lt;ul&gt;&lt;li&gt;MineBench: 2150.33 (#1/53)&lt;/li&gt;&lt;li&gt;PrinzBench: 91.0 (#1/29)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.1&lt;/strong&gt; — ELO 2009&lt;ul&gt;&lt;li&gt;Mercor APEX: 12.8 (#36/50)&lt;/li&gt;&lt;li&gt;BenchLM: 59.2 (#60/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LFM2.5-8B-A1B&lt;/strong&gt; — ELO 1666&lt;ul&gt;&lt;li&gt;AA MATH-500: 90.16 (#71/206)&lt;/li&gt;&lt;li&gt;BenchLM: 40.6 (#179/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna M.1&lt;/strong&gt; — ELO 1705&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 747.0 (#77/248)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 770.0 (#105/303)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark&lt;/strong&gt; — ELO 2377&lt;ul&gt;&lt;li&gt;BenchLM: 70.4 (#16/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron-4 15B&lt;/strong&gt; — ELO 1291&lt;ul&gt;&lt;li&gt;BenchLM: 44.3 (#155/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Pro&lt;/strong&gt; — ELO 1954&lt;ul&gt;&lt;li&gt;BenchLM: 45.0 (#152/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 Pro&lt;/strong&gt; — ELO 2275&lt;ul&gt;&lt;li&gt;BenchLM: 47.4 (#137/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.0 Lite&lt;/strong&gt; — ELO 2046&lt;ul&gt;&lt;li&gt;BenchLM: 49.1 (#130/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (60)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on CHI-Bench: 24.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Vals AI Public Benefits Bench: 70.43 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; on Mercor APEX: 42.5 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI Chess Leaderboard (Continuation): 736.0 (#80)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI Chess Leaderboard (Reasoning): 1181.0 (#41)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on BenchLM: 85.9 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Benchmarks.bio - EpiBench: 35.22 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Benchmarks.bio - SpatialBench-Long: 25.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Bullshit Benchmark: 60.0 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on CursorBench 3.1: 70.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Design Arena (Data Viz): 1338.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Design Arena (UI Components): 1387.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Design Arena (Website): 1331.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Epoch AI - ECI: 159.38 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM Stats (AutomationBench): 26.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM Stats (BrowseComp): 90.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM Stats (HealthBench Professional): 59.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM Stats (Legal Agent Benchmark): 11.7 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM2014 Logic 2026-07: 31.73 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Mercor APEX: 43.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Ramp SWE-Bench: 87.34 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on RuneBench: 7841.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Senior SWE-Bench: 28.2 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SimpleBench: 80.6 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI (Vals Index): 74.82 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI CyberBench: 40.68 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Excel Modeling: 73.56 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI GPQA: 93.43 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Harvey Legal Agent Bench: 6.67 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI LegalBench: 86.97 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI LiveCodeBench: 89.03 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Multimodal Index: 73.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI SAGE: 49.43 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI SkillsBench: 60.44 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI TaxEval v2: 75.14 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 84.64 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Vibe Code Bench: 88.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on You're Absolutely Right!: 4.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on BenchLM: 60.0 (#47)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on BenchLM: 62.8 (#41)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on BenchLM: 81.5 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CHI-Bench: 25.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Vending Bench 2: 9619.37 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on FoodTruckBench: 53229.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on GBA Eval: 0.5259 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on GDP.pdf: 30.7 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on HiL-Bench: 32.33 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - ARC-Challenge-IS: 95.22 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - Belebele-IS: 94.67 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - GED: 75.5 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - Inflection: 97.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - WikiQA-IS: 63.21 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - WinoGrande-IS: 94.49 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM Leaderboard - Average: 86.68 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Kaggle FACTS Grounding: 68.75 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Mercor APEX: 39.9 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on MyPCBench: 55.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI SkillsBench: 54.1 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vellum - GPQA: 94.6 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vellum - Humanity's Last Exam: 47.2 (#10)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (72)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;RuneBench&lt;/strong&gt;: Grok 4.5 (8716.0) beat GPT-5.6 Sol by 1316.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Vending Bench 2&lt;/strong&gt;: Claude Opus 4.7 (Unknown) (10936.76) beat GPT-5.5 by 309.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GDPval-AA&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Max Effort) (1861.0) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 101.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA GDPval&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Max Effort) (1860.57) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 100.97&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (GDPval-AA)&lt;/strong&gt;: Claude Opus 5 (1861.0) beat Claude Fable 5 by 46.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MineBench&lt;/strong&gt;: GPT-5.6 Pro Sol (2150.33) beat GPT-5.6 Sol by 41.54&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ASCIIBench&lt;/strong&gt;: Claude Opus 4.7 (1701.0) beat GPT-5.5 by 28.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;HiL-Bench&lt;/strong&gt;: Claude Fable 5 (56.33) beat GPT-5.5 by 27.23&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldCupBench&lt;/strong&gt;: Claude Fable 5 (110.0) beat MiniMax-M3 by 23.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Website)&lt;/strong&gt;: Kimi K3 (1375.0) beat GPT-5.6 Sol by 23.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ARC-AGI-3&lt;/strong&gt;: Claude Opus 5 (High) (30.16) beat GPT-5.6 Sol (Max) by 22.38&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - EnigmaEval&lt;/strong&gt;: Claude Fable 5 (High) (39.28) beat GPT-5.4 Pro (xHigh) by 15.46&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (UI Components)&lt;/strong&gt;: Kimi K3 (1408.0) beat GPT-5.6 Sol by 15.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Riemann-bench&lt;/strong&gt;: GPT-5.6 Sol (Max) (74.4) beat Claude Fable 5 by 14.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PrinzBench&lt;/strong&gt;: GPT-5.6 Pro Sol (91.0) beat GPT-5.5 Pro (Extended) by 9.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench - Completeness&lt;/strong&gt;: Troml (81.84) beat OpenClaw by 8.98&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Public Benefits Bench&lt;/strong&gt;: Claude Opus 5 (76.93) beat Kimi K3 by 8.66&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench&lt;/strong&gt;: Troml (76.79) beat OpenClaw by 8.57&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AutomationBench&lt;/strong&gt;: Claude Opus 5 (Max) (26.2) beat GPT-5.6 Sol (Max) by 8.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - VariantBench&lt;/strong&gt;: Claude Opus 5 (49.72) beat GPT-5.6 Sol by 7.62&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench - Recall&lt;/strong&gt;: Troml (86.55) beat OpenClaw by 7.53&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vellum - ARC-AGI-2&lt;/strong&gt;: GPT-5.6 Sol (92.5) beat GPT-5.5 by 7.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TrackingAI IQ Test (Vision)&lt;/strong&gt;: GPT-5.6 Terra (Ultra) (94.12) beat Claude Opus 4 (Thinking) by 6.62&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - BioSecBench-Surveillance&lt;/strong&gt;: Claude Opus 5 (59.8) beat Grok 4.5 by 6.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Text to Speech)&lt;/strong&gt;: google-gemini-3.1-flash-tts (1428.0) beat google-gemini-2.5-pro-tts by 6.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Legal Research Bench&lt;/strong&gt;: Claude Opus 5 (55.29) beat Claude Fable 5 by 5.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;NYT Connections Older Models&lt;/strong&gt;: ByteDance Seed2.1 Pro (97.8) beat GLM-5.2 (Thinking, Max) by 5.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI IOI&lt;/strong&gt;: Claude Opus 5 (91.67) beat GPT-5.6 Sol by 5.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI ProgramBench&lt;/strong&gt;: Claude Opus 5 (82.27) beat GPT-5.6 Sol by 4.63&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MedCode&lt;/strong&gt;: Claude Opus 5 (63.57) beat Gemini 3.1 Pro (Preview) by 4.51&lt;/li&gt;&lt;li&gt;&lt;strong&gt;YapBench&lt;/strong&gt;: GPT-5.6 Sol (18.5) beat GPT-3.5 Turbo by 4.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - Go&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Max Effort) (92.0) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI SkillsBench&lt;/strong&gt;: Grok 4.5 (66.03) beat GPT-5.5 Codex by 3.48&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EQ-Bench Longform Writing&lt;/strong&gt;: Claude Opus 5 (86.3) beat Claude Fable 5 by 3.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Content Alignment&lt;/strong&gt;: UniWorld-View (86.61) beat EvoPhys-World by 3.24&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - scBench-Long&lt;/strong&gt;: Claude Opus 5 (41.27) beat GPT-5.6 Sol by 3.17&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Camera Control&lt;/strong&gt;: UniWorld-View (97.72) beat EvoPhys-World by 3.16&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TrackingAI IQ Test (Mensa Norway)&lt;/strong&gt;: Grok 4.5 (100.0) beat GPT-5 Pro by 2.86&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Code Migration&lt;/strong&gt;: Claude Opus 5 (57.47) beat Claude Fable 5 by 2.41&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench - Correctness&lt;/strong&gt;: Troml (83.8) beat OpenClaw by 2.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MedScribe&lt;/strong&gt;: Claude Opus 5 (90.98) beat Muse Spark 1.1 by 2.09&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Document)&lt;/strong&gt;: Claude Opus 4.6 (1510.0) beat Claude Opus 4.6 (Thinking) by 2.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MortgageTax&lt;/strong&gt;: Claude Opus 5 (72.06) beat Claude Opus 4.7 by 1.79&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Motion Accuracy&lt;/strong&gt;: UniWorld-View (77.66) beat LTX-Video by 1.44&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI CorpFin v2&lt;/strong&gt;: Claude Opus 5 (73.19) beat Claude Fable 5 by 1.36&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BoxPwnr CTF Bench&lt;/strong&gt;: Grok 4.5 (xHigh) (56.73) beat GLM-5.1 by 1.26&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Object Control&lt;/strong&gt;: UniWorld-View (88.98) beat FantasyWorld-1.0 by 1.08&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Proofbench&lt;/strong&gt;: Claude Opus 5 (Max) (78.0) beat GPT-5.6 Sol (Max) by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI ProofBench&lt;/strong&gt;: Claude Opus 5 (78.0) beat GPT-5.6 Sol by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;P2PCLAW Innovative Benchmark&lt;/strong&gt;: API-User (9.1) beat cajal-9B-v2-q8-v7-4-fixed by 0.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSWE&lt;/strong&gt;: Claude Opus 5 (73.6) beat GPT-5.6 Sol by 0.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Artificial Analysis Intelligence Index&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Max Effort) (60.69) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 0.83&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI SWE-bench Verified&lt;/strong&gt;: Claude Opus 5 (97.0) beat GPT-5.6 Sol by 0.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Pedagogy - Maths&lt;/strong&gt;: Gemini 3.6 Flash (95.24) beat Gemini-3.1 Pro by 0.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Finance Agent v2&lt;/strong&gt;: Claude Opus 5 (58.63) beat Gemini 3.5 Flash by 0.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TrackingAI IQ Test&lt;/strong&gt;: Grok 4.5 (98.04) beat Claude Fable 5 by 0.74&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gert Labs Rankings&lt;/strong&gt;: Claude Fable 5 (72.78) beat GPT-5.6 Sol by 0.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vellum - HumanEval&lt;/strong&gt;: GPT-5.6 Sol (96.2) beat Claude Mythos 5 by 0.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MMMU&lt;/strong&gt;: Claude Opus 5 (89.88) beat Claude Fable 5 by 0.57&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Spider 2.0-Lite&lt;/strong&gt;: ktx (73.67) beat DivSkill-SQL by 0.54&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA MMMU-Pro&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Max Effort) (84.74) beat Gemini 3.5 Flash (High) by 0.46&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education SEND&lt;/strong&gt;: Gemini 3.6 Flash (88.53) beat GPT-5.5 by 0.46&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Static&lt;/strong&gt;: UniWorld-View (85.53) beat WorldScape-0.2(MoE) by 0.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kaggle FACTS Multimodal&lt;/strong&gt;: Gemini 3.6 Flash (47.21) beat Gemini 2.5 Pro by 0.35&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenClawProBench&lt;/strong&gt;: Kimi K3 (81.6) beat GLM-5.2 by 0.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vellum - Humanity's Last Exam&lt;/strong&gt;: Claude Opus 5 (64.7) beat Claude Mythos 5 by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Tool Hallucination&lt;/strong&gt;: Gemini 3 Flash (0.03) beat Qwen 3.7 Plus by 0.16&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore&lt;/strong&gt;: UniWorld-View (80.81) beat WorldScape-0.2(MoE) by 0.13&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (CyberGym)&lt;/strong&gt;: Gemini 3.5 Flash Cyber (83.2) beat Claude Mythos Preview by 0.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MMLU-Pro&lt;/strong&gt;: Claude Opus 5 (91.59) beat Claude Fable 5 by 0.09&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Photometric Consistency&lt;/strong&gt;: UniWorld-View (94.11) beat FantasyWorld-1.0 by 0.04&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProphetArena&lt;/strong&gt;: ap-gemini-3.5-flash (0.9629) beat Kimi K2.5 by 0.03&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-26

=== DAILY ===
NEW BENCHMARKS (1)
  - SpatialGen-Bench (Text Answering) (Overall Accuracy (%)): leader Claude Fable 5 (81.26), 25 models
      Spatial cognition benchmark from the ProVisE project (ZJU-OmniAI, "Show, Don\

NEW SCORES FROM TOP-10 MODELS (6)
  - Claude</summary></entry><entry><title>The Aggregate Digest — 2026-07-25</title><id>https://theaggregate.ai/digest/2026-07-25</id><updated>2026-07-25T06:36:16.452377+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;DecBench&lt;/strong&gt; (Exact Recovery (%)): leader GPT-5.6 Sol (53.5), 2 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Bongard Problems (Classic)&lt;/strong&gt; (Accuracy (% correct)): leader Gemini 3.1 Pro (Preview) (55.4), 4 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (DeepSWE 1.1)&lt;/strong&gt; (Score (%)): leader GPT-5.6 Sol (73.0), 18 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (FrontierCode 1.1)&lt;/strong&gt; (Score (%)): leader Claude Fable 5 (53.5), 15 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; — ELO 2882, #7&lt;ul&gt;&lt;li&gt;DeepSWE: 73.6 (#1/22)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - scBench-Long: 41.27 (#1/19)&lt;/li&gt;&lt;li&gt;Vellum - Humanity's Last Exam: 64.7 (#1/31)&lt;/li&gt;&lt;li&gt;Vals AI CorpFin v2: 73.19 (#1/126)&lt;/li&gt;&lt;li&gt;Vals AI Finance Agent v2: 58.63 (#1/40)&lt;/li&gt;&lt;li&gt;Vals AI MortgageTax: 72.06 (#1/90)&lt;/li&gt;&lt;li&gt;Vals AI MedCode: 63.57 (#1/76)&lt;/li&gt;&lt;li&gt;Vals AI MedScribe: 90.98 (#1/75)&lt;/li&gt;&lt;li&gt;Vals AI ProofBench: 78.0 (#1/54)&lt;/li&gt;&lt;li&gt;Vals AI Public Benefits Bench: 76.93 (#1/23)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (35)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI Chess Leaderboard (Continuation): 736.0 (#80)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI Chess Leaderboard (Reasoning): 1181.0 (#41)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Benchmarks.bio - SpatialBench-Long: 25.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Bullshit Benchmark: 60.0 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on CursorBench 3.1: 70.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Design Arena (Data Viz): 1303.0 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Epoch AI - ECI: 159.38 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM Stats (AutomationBench): 26.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM Stats (BrowseComp): 90.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM Stats (HealthBench Professional): 59.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM Stats (Legal Agent Benchmark): 11.7 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM2014 Logic 2026-07: 31.73 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Mercor APEX: 43.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Ramp SWE-Bench: 87.34 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on RuneBench: 7841.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SealedBench: 69.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Senior SWE-Bench: 28.2 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SimpleBench: 80.6 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI (Vals Index): 74.82 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI CyberBench: 40.68 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Excel Modeling: 73.56 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI GPQA: 93.43 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Harvey Legal Agent Bench: 6.67 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI LegalBench: 86.97 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI LiveCodeBench: 89.03 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Multimodal Index: 73.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI SAGE: 49.43 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI SkillsBench: 60.44 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI TaxEval v2: 75.14 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 84.64 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Vibe Code Bench: 88.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on You're Absolutely Right!: 4.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CHI-Bench: 25.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Benchmarks.bio - SpatialBench-Long: 12.5 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Benchmarks.bio - scBench-Long: 12.7 (#11)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (30)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GDPval-AA&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Max Effort) (1861.0) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 114.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA GDPval&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Max Effort) (1860.57) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 113.83&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (GDPval-AA)&lt;/strong&gt;: Claude Opus 5 (1861.0) beat Claude Fable 5 by 46.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ARC-AGI-3&lt;/strong&gt;: Claude Opus 5 (High) (30.16) beat GPT-5.6 Sol (Max) by 22.38&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - VariantBench&lt;/strong&gt;: opus-5 (49.72) beat GPT-5.6 Sol by 7.62&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - BioSecBench-Surveillance&lt;/strong&gt;: opus-5 (59.8) beat Grok 4.5 by 6.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Public Benefits Bench&lt;/strong&gt;: Claude Opus 5 (76.93) beat Claude Fable 5 by 6.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AutomationBench&lt;/strong&gt;: Claude Opus 5 (Max) (26.2) beat Gemini 3.6 Flash (High) by 6.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Legal Research Bench&lt;/strong&gt;: Claude Opus 5 (55.29) beat Claude Fable 5 by 5.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI IOI&lt;/strong&gt;: Claude Opus 5 (91.67) beat GPT-5.6 Sol by 5.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI ProgramBench&lt;/strong&gt;: Claude Opus 5 (82.27) beat GPT-5.6 Sol by 4.63&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MedCode&lt;/strong&gt;: Claude Opus 5 (63.57) beat Gemini 3.1 Pro (Preview) by 4.51&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - Go&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Max Effort) (92.0) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - scBench-Long&lt;/strong&gt;: Claude Opus 5 (41.27) beat GPT-5.6 Sol by 3.17&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Code Migration&lt;/strong&gt;: Claude Opus 5 (57.47) beat Claude Fable 5 by 2.41&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MedScribe&lt;/strong&gt;: Claude Opus 5 (90.98) beat Muse Spark 1.1 by 2.09&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA-Briefcase&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) (57.98) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 2.02&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BenchLM&lt;/strong&gt;: Claude Opus 5 (85.9) beat Claude Mythos 5 by 2.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MortgageTax&lt;/strong&gt;: Claude Opus 5 (72.06) beat Claude Opus 4.7 by 1.79&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI CorpFin v2&lt;/strong&gt;: Claude Opus 5 (73.19) beat Claude Fable 5 by 1.36&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Proofbench&lt;/strong&gt;: Claude Opus 5 (Max) (78.0) beat GPT-5.6 Sol (Max) by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI ProofBench&lt;/strong&gt;: Claude Opus 5 (78.0) beat GPT-5.6 Sol by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSWE&lt;/strong&gt;: Claude Opus 5 (73.6) beat GPT-5.6 Sol by 0.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Artificial Analysis Intelligence Index&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Max Effort) (60.69) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 0.83&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI SWE-bench Verified&lt;/strong&gt;: Claude Opus 5 (97.0) beat GPT-5.6 Sol by 0.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Finance Agent v2&lt;/strong&gt;: Claude Opus 5 (58.63) beat Gemini 3.5 Flash by 0.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MMMU&lt;/strong&gt;: Claude Opus 5 (89.88) beat Claude Fable 5 by 0.57&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA MMMU-Pro&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Max Effort) (84.74) beat Gemini 3.5 Flash (High) by 0.46&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vellum - Humanity's Last Exam&lt;/strong&gt;: Claude Opus 5 (64.7) beat Claude Mythos 5 by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MMLU-Pro&lt;/strong&gt;: Claude Opus 5 (91.59) beat Claude Fable 5 by 0.09&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-25

=== DAILY ===
NEW BENCHMARKS (4)
  - DecBench (Exact Recovery (%)): leader GPT-5.6 Sol (53.5), 2 models
  - Bongard Problems (Classic) (Accuracy (% correct)): leader Gemini 3.1 Pro (Preview) (55.4), 4 models
  - LLM Stats (DeepSWE 1.1) (Score (%)): leader GPT-5.6 S</summary></entry><entry><title>The Aggregate Digest — 2026-07-24</title><id>https://theaggregate.ai/digest/2026-07-24</id><updated>2026-07-24T06:45:02.455016+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;REFUTE&lt;/strong&gt; (Truth Score (accuracy + calibration, higher is better)): leader Grok 4.20 (74.5), 15 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SealedBench&lt;/strong&gt; (Capability Index): leader Claude Fable 5 (71.0), 28 models&lt;br&gt;&lt;span&gt;A private, continuously rotated frontier-capability eval whose tests, scoring weights and answer keys stay sealed to resist benchmark-specific training. Publishes a single composite Model Capability Index (0-100) blending capability, token efficiency, speed and cost, with thinking set to the highest available level.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on GDP.pdf: 30.7 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Kaggle FACTS Grounding: 68.75 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vellum - GPQA: 94.6 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vellum - Humanity's Last Exam: 47.2 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agents' Last Exam: 28.3 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on NYT Connections Extended: 94.5 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vellum - GPQA: 93.5 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vellum - HumanEval: 76.8 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vellum - Humanity's Last Exam: 56.0 (#4)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (11)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SEAL - EnigmaEval&lt;/strong&gt;: Claude Fable 5 (High) (39.28) beat GPT-5.4 Pro (xHigh) by 15.46&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vellum - ARC-AGI-2&lt;/strong&gt;: GPT-5.6 Sol (92.5) beat GPT-5.5 by 7.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Content Alignment&lt;/strong&gt;: UniWorld-View (86.61) beat EvoPhys-World by 3.24&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Camera Control&lt;/strong&gt;: UniWorld-View (97.72) beat EvoPhys-World by 3.16&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Motion Accuracy&lt;/strong&gt;: UniWorld-View (77.66) beat LTX-Video by 1.44&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Object Control&lt;/strong&gt;: UniWorld-View (88.98) beat FantasyWorld-1.0 by 1.08&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TrackingAI IQ Test&lt;/strong&gt;: Grok 4.5 (98.04) beat Claude Fable 5 by 0.74&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vellum - HumanEval&lt;/strong&gt;: GPT-5.6 Sol (96.2) beat Claude Mythos 5 by 0.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Static&lt;/strong&gt;: UniWorld-View (85.53) beat WorldScape-0.2(MoE) by 0.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore&lt;/strong&gt;: UniWorld-View (80.81) beat WorldScape-0.2(MoE) by 0.13&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Photometric Consistency&lt;/strong&gt;: UniWorld-View (94.11) beat FantasyWorld-1.0 by 0.04&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-24

=== DAILY ===
NEW BENCHMARKS (2)
  - REFUTE (Truth Score (accuracy + calibration, higher is better)): leader Grok 4.20 (74.5), 15 models
  - SealedBench (Capability Index): leader Claude Fable 5 (71.0), 28 models
      A private, continuously rotated frontier-capab</summary></entry><entry><title>The Aggregate Digest — 2026-07-23</title><id>https://theaggregate.ai/digest/2026-07-23</id><updated>2026-07-23T06:49:50.250436+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;ActiveVision&lt;/strong&gt; (Accuracy (%)): leader GPT-5.5 (10.6), 6 models&lt;br&gt;&lt;span&gt;activevision.dev &amp;quot;exam for active observers&amp;quot;: iterative visual reasoning where models must scan, traverse and transform images over multiple steps; accuracy over 85 items (human reference 96%).&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ActiveVision (Agents)&lt;/strong&gt; (Accuracy (%)): leader Claude Fable 5 (50.6), 3 models&lt;br&gt;&lt;span&gt;ActiveVision solved by tool-using agent harnesses (image-manipulation tools available) instead of pure chain-of-thought; accuracy over the same 85 items.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KernelBench Hub - CUDA&lt;/strong&gt; (Best % of Hardware Roofline): leader Claude Fable 5 (72.66), 5 models&lt;br&gt;&lt;span&gt;kernelbench.com CUDA suite (independent of Stanford KernelBench): agentic CUDA kernel optimization scored as percent of hardware roofline achieved, best across RTX PRO 6000, H100 and B200 runs.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Time Horizon Index&lt;/strong&gt; (Progress (%)): leader Claude Opus 4.8 (11.83), 4 models&lt;br&gt;&lt;span&gt;Vals AI Kerbal Space Program agent benchmark: how far a model progresses through a 30-mission space program (rocket design, orbital mechanics) in a 120-hour window; each mission rung is 3.33% progress.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (7)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on CHI-Bench: 24.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena: 9.71 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena - Bash Recovery: 6.33 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena - Confirmed Success: 14.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena - Praise vs Complaint: 20.3 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena - Steerability: 6.52 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena - Tool Hallucination: 1.39 (#25)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;TrackingAI IQ Test (Vision)&lt;/strong&gt;: GPT-5.6 Terra (Ultra) (92.16) beat Claude Opus 4 (Thinking) by 4.66&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kaggle FACTS Multimodal&lt;/strong&gt;: Gemini 3.6 Flash (50.24) beat Gemini 2.5 Pro by 3.38&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Public Benefits Bench&lt;/strong&gt;: Claude Fable 5 (70.43) beat Kimi K3 by 2.16&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AutomationBench&lt;/strong&gt;: Gemini 3.6 Flash (High) (19.8) beat GPT-5.6 Sol (Max) by 1.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Pedagogy - Maths&lt;/strong&gt;: Gemini-3.6 Flash (95.24) beat Gemini-3.1 Pro by 0.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education SEND&lt;/strong&gt;: Gemini-3.6 Flash (88.53) beat GPT-5.5 by 0.46&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-23

=== DAILY ===
NEW BENCHMARKS (4)
  - ActiveVision (Accuracy (%)): leader GPT-5.5 (10.6), 6 models
      activevision.dev "exam for active observers": iterative visual reasoning where models must scan, traverse and transform images over multiple steps; accuracy over</summary></entry><entry><title>The Aggregate Digest — 2026-07-22</title><id>https://theaggregate.ai/digest/2026-07-22</id><updated>2026-07-22T06:52:29.593249+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (14)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LLM Arena RU&lt;/strong&gt; (Arena Elo): leader Gemini 3 Pro (Preview) (1210.0), 92 models&lt;br&gt;&lt;span&gt;Crowdsourced blind pairwise battles in Russian: Bradley-Terry Elo rating from user votes on llmarena.ru, the Russian-language counterpart of LMArena.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA-Briefcase&lt;/strong&gt; (Rubric Pass Rate (%)): leader Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (55.96), 47 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FutureSim&lt;/strong&gt; (Top-1 Accuracy (%)): leader Claude Fable 5 (26.52), 9 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProfBench&lt;/strong&gt; (Overall Rubric Score (%)): leader Claude Opus 4.7 (Thinking) (61.3), 98 models&lt;br&gt;&lt;span&gt;Professional report-writing tasks graded against rubrics written by PhD physicists and chemists and MBA-level finance and consulting experts; rubric satisfaction across the four domains.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SalesBench&lt;/strong&gt; (50-Lead Reward): leader GLM-5.1 (0.508), 7 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DrugDiscoveryBench&lt;/strong&gt; (Score (%)): leader GPT-5.5 (51.6), 7 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TextQuests (No Clues)&lt;/strong&gt; (Avg Game Progress (%)): leader Claude Fable 5 (54.48), 35 models&lt;br&gt;&lt;span&gt;Playing 25 classic Infocom interactive-fiction games (Zork etc.) without hints: average game completion via long-horizon exploration, puzzle solving and state tracking in a text world.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TextQuests (With Clues)&lt;/strong&gt; (Avg Game Progress (%)): leader GPT-5.6 Sol (86.84), 35 models&lt;br&gt;&lt;span&gt;Playing 25 classic Infocom interactive-fiction games with the official hint books available: average game completion, testing how well models exploit in-context guidance over long horizons.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RevengeBench&lt;/strong&gt; (Arena Mean Score): leader GPT-5 (71.92), 12 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GameCraft-Bench&lt;/strong&gt; (Overall Score): leader Claude Fable 5 (65.7), 10 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kagi LLM Benchmark&lt;/strong&gt; (Accuracy (%)): leader Claude Fable 5 (Thinking) (91.4), 145 models&lt;br&gt;&lt;span&gt;Rotating set of unpublished reasoning, coding and instruction-following tasks run by Kagi; accuracy on ~116 private tasks designed to resist benchmark contamination.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SpeechMap Compliance&lt;/strong&gt; (% Requests Completed): leader sherlock-dash-alpha (100.0), 344 models&lt;br&gt;&lt;span&gt;Willingness to answer sensitive or controversial prompts (political argument, satire, religion, rights advocacy): share of requests completed directly rather than refused, evaded or errored. Behavioral propensity, not capability.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SnitchBench&lt;/strong&gt; (Govt Contact Rate (%)): leader Grok 4.1 (92.5), 8 models&lt;br&gt;&lt;span&gt;Propensity to autonomously report user wrongdoing: rate at which a model, given evidence of corporate misconduct and email tools, contacts government authorities. Behavioral propensity, not capability.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MLS-Bench Lite&lt;/strong&gt; (Score): leader Claude Fable 5 (49.9), 12 models&lt;br&gt;&lt;span&gt;Official 30-task subset of MLS-Bench for evaluating whether AI systems can invent generalizable and scalable machine-learning methods.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.6 Flash&lt;/strong&gt; — ELO 2417, #23&lt;ul&gt;&lt;li&gt;RuneBench: 7454.0 (#1/39)&lt;/li&gt;&lt;li&gt;Design Arena (3D): 1384.0 (#2/133)&lt;/li&gt;&lt;li&gt;LLM Stats (OSWorld-Verified): 83.0 (#3/21)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 1782.0 (#3/244)&lt;/li&gt;&lt;li&gt;LLM Stats (CharXiv-R): 89.4 (#5/47)&lt;/li&gt;&lt;li&gt;Arabic Broad Leaderboard: 9.111 (#6/106)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1763.0 (#6/300)&lt;/li&gt;&lt;li&gt;Kaggle FACTS Grounding: 72.51 (#6/40)&lt;/li&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 54.0 (#7/21)&lt;/li&gt;&lt;li&gt;Vals AI MedCode: 53.15 (#7/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash Lite&lt;/strong&gt; — ELO 1973, #146&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 1512.0 (#9/244)&lt;/li&gt;&lt;li&gt;LLM Stats (OSWorld-Verified): 74.0 (#11/21)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 54.0 (#15/15)&lt;/li&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 21.3 (#18/21)&lt;/li&gt;&lt;li&gt;RuneBench: 2254.0 (#18/39)&lt;/li&gt;&lt;li&gt;AA MMMU-Pro: 79.02 (#24/228)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1399.0 (#24/300)&lt;/li&gt;&lt;li&gt;LLM Stats (CharXiv-R): 76.5 (#29/47)&lt;/li&gt;&lt;li&gt;LLM Stats (GDPval-AA): 1140.0 (#30/41)&lt;/li&gt;&lt;li&gt;Arabic Broad Leaderboard: 8.626 (#34/106)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; on Guesswork: 0.977 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Pro Sol&lt;/strong&gt; on MineBench: 2159.91 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Vending Bench 2: 9619.37 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on HiL-Bench: 32.33 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI SkillsBench: 54.1 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on GDP.pdf: 19.0 (#11)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;RuneBench&lt;/strong&gt;: Gemini 3.6 Flash (7454.0) beat GPT-5.6 Sol by 54.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;HiL-Bench&lt;/strong&gt;: Claude Fable 5 (56.33) beat GPT-5.5 by 27.23&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench - Completeness&lt;/strong&gt;: Troml (81.84) beat OpenClaw by 8.98&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench&lt;/strong&gt;: Troml (76.79) beat OpenClaw by 8.57&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench - Recall&lt;/strong&gt;: Troml (86.55) beat OpenClaw by 7.53&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI SkillsBench&lt;/strong&gt;: Grok 4.5 (66.03) beat GPT-5.5 Codex by 3.48&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench - Correctness&lt;/strong&gt;: Troml (83.8) beat OpenClaw by 2.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BoxPwnr CTF Bench&lt;/strong&gt;: Grok 4.5 (xHigh) (56.73) beat GLM-5.1 by 1.26&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (CyberGym)&lt;/strong&gt;: Gemini 3.5 Flash Cyber (83.2) beat Claude Mythos Preview by 0.1&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-22

=== DAILY ===
NEW BENCHMARKS (14)
  - LLM Arena RU (Arena Elo): leader Gemini 3 Pro (Preview) (1210.0), 92 models
      Crowdsourced blind pairwise battles in Russian: Bradley-Terry Elo rating from user votes on llmarena.ru, the Russian-language counterpart of LMAr</summary></entry><entry><title>The Aggregate Digest — 2026-07-21</title><id>https://theaggregate.ai/digest/2026-07-21</id><updated>2026-07-21T06:47:55.752132+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (10)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;MathArena - ARXIV_FALSE June&lt;/strong&gt; (Accuracy (%)): leader GPT-5.5 (xHigh) (69.44), 12 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MathArena - ARXIV June&lt;/strong&gt; (Accuracy (%)): leader GPT-5.6 Sol (Max) (86.73), 12 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Office Comprehension Bench - File Fidelity Excel&lt;/strong&gt; (File Fidelity Accuracy (%)): leader GPT-5.5 (Thinking) (72.6), 4 models&lt;br&gt;&lt;span&gt;Perceiving structural and visual content in native .xlsx files — tables, charts, embedded images and formatting — answered from the file itself rather than a text conversion.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Office Comprehension Bench - File Fidelity PowerPoint&lt;/strong&gt; (File Fidelity Accuracy (%)): leader Claude Opus 4.7 (86.6), 4 models&lt;br&gt;&lt;span&gt;Perceiving structural and visual content in native .pptx decks — slide layouts, charts, images and formatting — answered from the file itself.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Office Comprehension Bench - File Fidelity Word&lt;/strong&gt; (File Fidelity Accuracy (%)): leader Claude Opus 4.7 (91.5), 4 models&lt;br&gt;&lt;span&gt;Perceiving structural and visual content in native .docx files — tables, figures and formatting — answered from the file itself; the widest model spread of the three applications.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GRIPS&lt;/strong&gt; (Accuracy (%)): leader GPT-5.5 (xHigh) (96.4), 27 models&lt;br&gt;&lt;span&gt;German Reasoning, Idioms, Puzzles &amp;amp; Wordplay (Sprachspiel): a held-out private set of German-language puzzles, idiomatic expressions and wordplay that resist translation, scored by LLM judge.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GRIPS-hard&lt;/strong&gt; (Accuracy (%)): leader GPT-5.5 (xHigh) (87.3), 27 models&lt;br&gt;&lt;span&gt;The hard subset of GRIPS, restricted to the German reasoning, idiom and wordplay items that discriminate most between models; scores drop sharply versus the full set.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Guesswork&lt;/strong&gt; (MAE (z-score units)): leader Gemma 3 4B (IT) (6.7079), 17 models&lt;br&gt;&lt;span&gt;This site&amp;#x27;s own live benchmark for predicting benchmark scores: frontier and budget LLMs forecast newly published (model, benchmark) results a day before they land, scored in per-benchmark z-units (MAE, lower is better) against the same-information statistical baseline The Aggregate.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;StructureClaw (Automatic Workflow)&lt;/strong&gt; (Success Rate (%)): leader Kimi K2.6 (100.0), 9 models&lt;br&gt;&lt;span&gt;StructureClaw executable agent benchmark (arXiv 2607.14896); the automatic-workflow track reports the success rate of building a working structured-extraction agent without human guidance.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM GPU Kernel Generation&lt;/strong&gt; (Pass Rate (%)): leader GPT-5.5 (100.0), 5 models&lt;br&gt;&lt;span&gt;Trace-driven benchmark for LLM-generated GPU kernels (arXiv 2607.14541): the fraction of generated kernels that both compile and produce numerically correct results against reference execution traces.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (36)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; on Mercor APEX: 42.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on BenchLM: 60.9 (#44)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on BenchLM: 63.7 (#38)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on BenchLM: 82.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - ARC-Challenge-IS: 95.22 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - Belebele-IS: 94.67 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - GED: 75.5 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - Inflection: 97.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - WikiQA-IS: 63.21 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM - WinoGrande-IS: 94.49 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Icelandic LLM Leaderboard - Average: 86.68 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Mercor APEX: 39.9 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Pedagogy: 87.76 (#31)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Pedagogy - Maths: 89.68 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Pedagogy - Primary: 92.49 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Pedagogy - Science: 89.62 (#48)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Pedagogy - Secondary: 86.64 (#40)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Pedagogy - Social studies: 84.55 (#51)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Pedagogy - Technology: 82.08 (#71)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education SEND: 81.65 (#32)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena: 9.62 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena - Bash Recovery: 6.41 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena - Confirmed Success: 14.42 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena - Praise vs Complaint: 20.62 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena - Steerability: 5.58 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Agent Arena - Tool Hallucination: 1.08 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on BenchLM: 81.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Benchmarks.bio - VariantBench: 32.8 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Creative Writing (Lechmazur): 2.9 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on GBA Eval: 0.4835 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on GBA Eval: 0.4835 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on MineBench: 1756.72 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Multi-turn Debate (Lechmazur): 1740.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on PrinzBench: 47.0 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Riemann-bench: 37.6 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on TaxCalcBench: 6.0 (#9)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Design Arena (UI Components)&lt;/strong&gt;: Kimi K3 (1443.0) beat GPT-5.6 Sol by 55.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Riemann-bench&lt;/strong&gt;: GPT-5.6 Sol (Max) (74.4) beat Claude Fable 5 by 14.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PrinzBench&lt;/strong&gt;: GPT-5.6 Pro Sol (91.0) beat GPT-5.5 Pro (Extended) by 9.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenClawProBench&lt;/strong&gt;: Kimi K3 (81.6) beat GLM-5.2 by 0.3&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-21

=== DAILY ===
NEW BENCHMARKS (10)
  - MathArena - ARXIV_FALSE June (Accuracy (%)): leader GPT-5.5 (xHigh) (69.44), 12 models
  - MathArena - ARXIV June (Accuracy (%)): leader GPT-5.6 Sol (Max) (86.73), 12 models
  - Office Comprehension Bench - File Fidelity Excel </summary></entry><entry><title>The Aggregate Digest — 2026-07-20</title><id>https://theaggregate.ai/digest/2026-07-20</id><updated>2026-07-20T07:04:39.733350+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (8)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SWE-Milestone&lt;/strong&gt; (Milestone Score (%)): leader Claude Opus 4.8 (Max, 1M) (51.84), 23 models&lt;br&gt;&lt;span&gt;SWE-Milestone evaluates coding agents on software-evolution itineraries mined from real repositories as milestone DAGs, requiring sustained multi-milestone implementation; scored by milestone completion with the best harness retained per model.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ErdosBench&lt;/strong&gt; (Judge Average (0-4)): leader GPT-5.6 Sol (xHigh) (3.12), 7 models&lt;br&gt;&lt;span&gt;Ulam\&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MWS Vision Bench&lt;/strong&gt; (Overall Score (%)): leader Cotype Pro 3 (73.6), 38 models&lt;br&gt;&lt;span&gt;MTS AI\&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VSI-Super-Wild&lt;/strong&gt; (Overall Accuracy (%)): leader Gemini 3.1 Pro (Preview) (44.36), 14 models&lt;br&gt;&lt;span&gt;VSI-Super-Wild (ECCV 2026) probes spatial supersensing in genuinely long in-the-wild videos — up to 4+ hours — with human-verified questions on motion, ordering, and continuous counting; scored by overall accuracy.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FutureX&lt;/strong&gt; (Overall Score (latest week, %)): leader Qwen 3.7 Max (49.33), 15 models&lt;br&gt;&lt;span&gt;FutureX is ByteDance\&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WeaveBench&lt;/strong&gt; (PassRate (%)): leader Claude Opus 4.7 (35.1), 10 models&lt;br&gt;&lt;span&gt;WeaveBench tests computer-use agents on 114 long-horizon real-world tasks that require interleaving GUI clicks with shell and code in one trajectory, graded by a trajectory-aware agent judge; scored by pass rate.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SolarBench&lt;/strong&gt; (Pass Rate (%)): leader Claude Fable 5 (53.8), 11 models&lt;br&gt;&lt;span&gt;Maingen\&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EdgeBench&lt;/strong&gt; (Score @12h (134 tasks)): leader Claude Opus 4.8 (50.89), 5 models&lt;br&gt;&lt;span&gt;ByteDance Seed\&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (7)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5&lt;/strong&gt; on ForecastBench: 64.6 (#65)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on GBA Eval: 0.5259 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on MyPCBench: 55.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on YapBench: 18.5 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on YapBench: 18.5 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Gert Labs Rankings: 67.79 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on YapBench: 300.7 (#63)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Website)&lt;/strong&gt;: Kimi K3 (1396.0) beat GPT-5.6 Sol by 44.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;P2PCLAW Innovative Benchmark&lt;/strong&gt;: API-User (9.1) beat cajal-9B-v2-q8-v7-4-fixed by 0.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Spider 2.0-Lite&lt;/strong&gt;: ktx (73.67) beat DivSkill-SQL by 0.54&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProphetArena&lt;/strong&gt;: ap-gemini-3.5-flash (0.9629) beat Kimi K2.5 by 0.03&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-20

=== DAILY ===
NEW BENCHMARKS (8)
  - SWE-Milestone (Milestone Score (%)): leader Claude Opus 4.8 (Max, 1M) (51.84), 23 models
      SWE-Milestone evaluates coding agents on software-evolution itineraries mined from real repositories as milestone DAGs, requiring sus</summary></entry><entry><title>The Aggregate Digest — 2026-07-19</title><id>https://theaggregate.ai/digest/2026-07-19</id><updated>2026-07-19T06:47:08.069151+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SCALE SQL Understanding&lt;/strong&gt; (Ability Score (%)): leader Gemini 3 Pro (86.0), 35 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SCALE SQL Dialect Conversion&lt;/strong&gt; (Ability Score (%)): leader Qwen 3.7 Max (77.3), 35 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SCALE SQL Optimization&lt;/strong&gt; (Ability Score (%)): leader Gemini 3.5 Flash (69.2), 35 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ParseBench&lt;/strong&gt; (Overall Score): leader KDL-Frontier-Parser-nano (76.36), 50 models&lt;br&gt;&lt;span&gt;Enterprise document parsing benchmark over tables, charts, layout, and content faithfulness for multimodal extraction systems.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OmniaBench&lt;/strong&gt; (Overall Pass@1 (%)): leader Claude Sonnet 5 (58.54), 22 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PawBench - QwenPaw&lt;/strong&gt; (Overall Score (%)): leader Qwen 3.6 Max Preview (78.35), 9 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PawBench - OpenClaw&lt;/strong&gt; (Overall Score (%)): leader Claude Opus 4.6 (76.11), 9 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PawBench - Hermes&lt;/strong&gt; (Overall Score (%)): leader Claude Opus 4.6 (78.44), 9 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LoHoSearch&lt;/strong&gt; (Accuracy (%)): leader GPT-5.5 (34.74), 11 models&lt;br&gt;&lt;span&gt;LoHoSearch evaluates long-horizon search agents on 544 human-verified questions requiring multi-step open-web research across 11 topical domains; this board reports the paper\&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (18)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA APEX-Agents: 41.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Arabic Broad Leaderboard: 8.906 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on HieroglyphBench: 25.9 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on KernelBench Hub - Mega: 18.09 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on KernelBench Hub - Mega: 18.09 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI GPQA: 92.93 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Harvey Legal Agent Bench: 10.83 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Legal Research Bench: 44.23 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI LegalBench: 86.02 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI LiveCodeBench: 87.19 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI MMLU-Pro: 87.97 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI MMMU: 88.15 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI MedScribe: 87.96 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI MortgageTax: 66.34 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Multimodal Index: 73.42 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI SAGE: 54.26 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI TaxEval v2: 75.72 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on You're Absolutely Right!: 3.5 (#8)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Design Arena (3D)&lt;/strong&gt;: Kimi K3 (1441.0) beat Claude Fable 5 by 74.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Data Viz)&lt;/strong&gt;: Kimi K3 (1429.0) beat Claude Fable 5 by 65.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Legal Research Bench&lt;/strong&gt;: Claude Fable 5 (49.52) beat GPT-5.6 Sol by 1.44&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Excel Modeling&lt;/strong&gt;: Claude Fable 5 (73.67) beat GPT-5.6 Sol by 1.33&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMEB Leaderboard&lt;/strong&gt;: DME-Large (80.24) beat octen-vl-embedding-large by 0.15&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Public Benefits Bench&lt;/strong&gt;: Kimi K3 (68.27) beat Claude Opus 4.8 by 0.14&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Weekly&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SCALE SQL Understanding&lt;/strong&gt; (Ability Score (%)): leader Gemini 3 Pro (86.0), 35 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SCALE SQL Dialect Conversion&lt;/strong&gt; (Ability Score (%)): leader Qwen 3.7 Max (77.3), 35 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SCALE SQL Optimization&lt;/strong&gt; (Ability Score (%)): leader Gemini 3.5 Flash (69.2), 35 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ParseBench&lt;/strong&gt; (Overall Score): leader KDL-Frontier-Parser-nano (76.36), 50 models&lt;br&gt;&lt;span&gt;Enterprise document parsing benchmark over tables, charts, layout, and content faithfulness for multimodal extraction systems.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OmniaBench&lt;/strong&gt; (Overall Pass@1 (%)): leader Claude Sonnet 5 (58.54), 22 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PawBench - QwenPaw&lt;/strong&gt; (Overall Score (%)): leader Qwen 3.6 Max Preview (78.35), 9 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PawBench - OpenClaw&lt;/strong&gt; (Overall Score (%)): leader Claude Opus 4.6 (76.11), 9 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PawBench - Hermes&lt;/strong&gt; (Overall Score (%)): leader Claude Opus 4.6 (78.44), 9 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LoHoSearch&lt;/strong&gt; (Accuracy (%)): leader GPT-5.5 (34.74), 11 models&lt;br&gt;&lt;span&gt;LoHoSearch evaluates long-horizon search agents on 544 human-verified questions requiring multi-step open-web research across 11 topical domains; this board reports the paper\&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (72)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; — ELO 3074, #6&lt;ul&gt;&lt;li&gt;Android Bench: 84.5 (#1/25)&lt;/li&gt;&lt;li&gt;Terminal-Bench 2.1: 83.8 (#1/12)&lt;/li&gt;&lt;li&gt;Terminal-Bench 2.1 (Claude Code): 83.8 (#1/5)&lt;/li&gt;&lt;li&gt;SvelteBench: 100.0 (#1/152)&lt;/li&gt;&lt;li&gt;GeoBench ACW: 4403.7 (#1/48)&lt;/li&gt;&lt;li&gt;GeoBench Photos: 4313.64 (#1/32)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 73.67 (#1/25)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 49.52 (#1/24)&lt;/li&gt;&lt;li&gt;Arabic Broad Leaderboard: 8.217 (#40/104)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; — ELO 2874, #8&lt;ul&gt;&lt;li&gt;BridgeBench Security: 1023.1 (#1/5)&lt;/li&gt;&lt;li&gt;BridgeBench Debugging: 1066.7 (#1/3)&lt;/li&gt;&lt;li&gt;BridgeBench Refactoring: 1065.7 (#1/3)&lt;/li&gt;&lt;li&gt;BridgeBench Hallucination: 1030.4 (#1/3)&lt;/li&gt;&lt;li&gt;Design Arena (Data Viz): 1429.0 (#1/139)&lt;/li&gt;&lt;li&gt;Design Arena (3D): 1441.0 (#1/131)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 33.4 (#1/159)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Code): 1679.0 (#1/99)&lt;/li&gt;&lt;li&gt;LLM Stats (APEX-Agents): 37.6 (#1/7)&lt;/li&gt;&lt;li&gt;LLM Stats (BabyVision): 85.7 (#1/9)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; — ELO 2827, #9&lt;ul&gt;&lt;li&gt;DeepSWE: 72.7 (#1/20)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - SpatialBench-Long: 38.89 (#1/18)&lt;/li&gt;&lt;li&gt;ZeroEval GPQA Diamond: 94.6 (#1/232)&lt;/li&gt;&lt;li&gt;MineBench: 2108.79 (#1/50)&lt;/li&gt;&lt;li&gt;Agents' Last Exam: 30.6 (#1/20)&lt;/li&gt;&lt;li&gt;AgenticVBench: 38.4 (#1/10)&lt;/li&gt;&lt;li&gt;LLM Stats (Graphwalks BFS &gt;128k): 90.7 (#1/11)&lt;/li&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 91.5 (#1/19)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 88.8 (#1/13)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - match (process): 88.9 (#1/64)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; — ELO 2741, #10&lt;ul&gt;&lt;li&gt;BridgeBench Security: 1001.5 (#2/5)&lt;/li&gt;&lt;li&gt;SvelteBench: 100.0 (#4/152)&lt;/li&gt;&lt;li&gt;Android Bench: 72.4 (#6/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Pro Sol&lt;/strong&gt; — ELO 2671, #11&lt;ul&gt;&lt;li&gt;Arabic Broad Leaderboard: 8.97 (#12/104)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5&lt;/strong&gt; — ELO 2620, #12&lt;ul&gt;&lt;li&gt;GDP.pdf: 52.8 (#2/20)&lt;/li&gt;&lt;li&gt;ExploitGym: 129.0 (#3/9)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; — ELO 2590, #13&lt;ul&gt;&lt;li&gt;Vals AI Finance Agent v2: 47.78 (#16/37)&lt;/li&gt;&lt;li&gt;Android Bench: 54.2 (#20/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; — ELO 2556, #14&lt;ul&gt;&lt;li&gt;EQ-Bench Longform Writing: 72.5 (#22/123)&lt;/li&gt;&lt;li&gt;RuneBench: 1590.0 (#24/33)&lt;/li&gt;&lt;li&gt;ARC-AGI-2: 36.53 (#47/166)&lt;/li&gt;&lt;li&gt;ARC-AGI-1: 79.5 (#48/164)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; — ELO 2532, #15&lt;ul&gt;&lt;li&gt;LLM Stats (MCP Atlas): 88.1 (#1/30)&lt;/li&gt;&lt;li&gt;LLM Stats (Toolathlon): 75.6 (#1/30)&lt;/li&gt;&lt;li&gt;LLM Stats (BabyVision): 76.3 (#2/9)&lt;/li&gt;&lt;li&gt;LLM Stats (Finance Agent v2): 57.2 (#2/26)&lt;/li&gt;&lt;li&gt;Arabic Broad Leaderboard: 9.2 (#4/104)&lt;/li&gt;&lt;li&gt;LLM Stats (OSWorld-Verified): 80.8 (#4/19)&lt;/li&gt;&lt;li&gt;OSWorld: 80.67 (#5/63)&lt;/li&gt;&lt;li&gt;LLM Stats (CharXiv-R): 88.4 (#5/45)&lt;/li&gt;&lt;li&gt;HieroglyphBench: 24.5 (#6/19)&lt;/li&gt;&lt;li&gt;Terminal-Bench 2.1: 76.2 (#6/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Terra&lt;/strong&gt; — ELO 2489, #18&lt;ul&gt;&lt;li&gt;Benchmarks.bio - SpatialBench-Long: 22.22 (#2/18)&lt;/li&gt;&lt;li&gt;WolfBench: 82.0 (#2/32)&lt;/li&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 89.6 (#2/19)&lt;/li&gt;&lt;li&gt;LLM Stats (HealthBench): 57.0 (#3/8)&lt;/li&gt;&lt;li&gt;LLM Stats (HealthBench Hard): 32.7 (#3/9)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 87.4 (#3/13)&lt;/li&gt;&lt;li&gt;Kaggle Game Arena Poker (Heads Up): 17.85 (#3/24)&lt;/li&gt;&lt;li&gt;Clerk LLM Leaderboard: 79.2 (#4/22)&lt;/li&gt;&lt;li&gt;LLM Stats (BrowseComp): 87.5 (#4/57)&lt;/li&gt;&lt;li&gt;LLM Stats (Graphwalks BFS &gt;128k): 76.9 (#4/11)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash&lt;/strong&gt; — ELO 2477, #19&lt;ul&gt;&lt;li&gt;Chatbot Arena (Code): 1504.0 (#19/99)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 5&lt;/strong&gt; — ELO 2462, #20&lt;ul&gt;&lt;li&gt;Android Bench: 76.2 (#3/25)&lt;/li&gt;&lt;li&gt;Terminal-Bench 2.1 (Claude Code): 74.6 (#3/5)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - SpatialBench-Long: 12.5 (#5/18)&lt;/li&gt;&lt;li&gt;CHI-Bench: 20.0 (#7/18)&lt;/li&gt;&lt;li&gt;Terminal-Bench 2.1: 74.6 (#8/12)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - BioSecBench-Refusal: 30.1 (#11/15)&lt;/li&gt;&lt;li&gt;GeoBench Photos: 3713.48 (#12/32)&lt;/li&gt;&lt;li&gt;GeoBench ACW: 3878.41 (#19/48)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy: 88.21 (#22/221)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 82.57 (#22/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.7&lt;/strong&gt; — ELO 2436, #22&lt;ul&gt;&lt;li&gt;Creative Writing (Lechmazur): 2.5 (#7/38)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.5&lt;/strong&gt; — ELO 2436, #23&lt;ul&gt;&lt;li&gt;Benchmarks.bio - SpatialBench-Long: 19.44 (#3/18)&lt;/li&gt;&lt;li&gt;Terminal-Bench 2.1: 79.3 (#3/12)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test (Offline): 81.25 (#5/35)&lt;/li&gt;&lt;li&gt;Blueprint-Bench 2: 0.273 (#6/18)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 83.3 (#6/13)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Secondary: 89.31 (#6/221)&lt;/li&gt;&lt;li&gt;React Native Evals: 84.58 (#7/26)&lt;/li&gt;&lt;li&gt;Kaggle Game Arena Poker (Heads Up): 5.18 (#7/24)&lt;/li&gt;&lt;li&gt;ZeroEval GPQA Diamond: 93.0 (#9/232)&lt;/li&gt;&lt;li&gt;HieroglyphBench: 21.2 (#9/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.2&lt;/strong&gt; — ELO 2400, #27&lt;ul&gt;&lt;li&gt;NatureBench: 15.56 (#2/12)&lt;/li&gt;&lt;li&gt;Android Bench: 72.2 (#7/25)&lt;/li&gt;&lt;li&gt;CHI-Bench: 18.7 (#9/18)&lt;/li&gt;&lt;li&gt;React Native Evals: 78.36 (#14/26)&lt;/li&gt;&lt;li&gt;Design Arena (SVG): 1260.0 (#19/100)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Luna&lt;/strong&gt; — ELO 2386, #30&lt;ul&gt;&lt;li&gt;Clerk LLM Leaderboard: 83.6 (#2/22)&lt;/li&gt;&lt;li&gt;LLM Stats (Graphwalks BFS &gt;128k): 81.3 (#2/11)&lt;/li&gt;&lt;li&gt;Vals AI CyberBench: 83.9 (#2/17)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - SpatialBench-Long: 18.06 (#4/18)&lt;/li&gt;&lt;li&gt;WolfBench: 79.0 (#4/32)&lt;/li&gt;&lt;li&gt;LLM Stats (HealthBench Hard): 32.0 (#4/9)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 84.7 (#4/13)&lt;/li&gt;&lt;li&gt;Kaggle Game Arena Poker (Heads Up): 15.95 (#4/24)&lt;/li&gt;&lt;li&gt;Vals AI Finance Agent v2: 55.04 (#4/37)&lt;/li&gt;&lt;li&gt;Vals AI SWE-bench Verified: 93.0 (#4/72)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Plus&lt;/strong&gt; — ELO 2326, #36&lt;ul&gt;&lt;li&gt;Design Arena (3D): 1324.0 (#9/131)&lt;/li&gt;&lt;li&gt;Android Bench: 57.7 (#18/25)&lt;/li&gt;&lt;li&gt;Design Arena (Data Viz): 1280.0 (#19/139)&lt;/li&gt;&lt;li&gt;Design Arena (Game Dev): 1276.0 (#26/141)&lt;/li&gt;&lt;li&gt;Design Arena (UI Components): 1279.0 (#29/136)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro&lt;/strong&gt; — ELO 2286, #44&lt;ul&gt;&lt;li&gt;FutureEval: 2.43 (#46/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M3&lt;/strong&gt; — ELO 2272, #48&lt;ul&gt;&lt;li&gt;NatureBench: 11.11 (#6/12)&lt;/li&gt;&lt;li&gt;Android Bench: 63.6 (#13/25)&lt;/li&gt;&lt;li&gt;Creative Writing (Lechmazur): 0.7 (#16/38)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro&lt;/strong&gt; — ELO 2251, #51&lt;ul&gt;&lt;li&gt;Android Bench: 59.5 (#17/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.7 Code&lt;/strong&gt; — ELO 2250, #52&lt;ul&gt;&lt;li&gt;Android Bench: 70.4 (#9/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5-Pro&lt;/strong&gt; — ELO 2236, #55&lt;ul&gt;&lt;li&gt;Android Bench: 60.8 (#16/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hy3&lt;/strong&gt; — ELO 2227, #60&lt;ul&gt;&lt;li&gt;LLM Stats (SkillsBench): 55.3 (#2/6)&lt;/li&gt;&lt;li&gt;LLM Stats (IMO-AnswerBench): 90.0 (#3/19)&lt;/li&gt;&lt;li&gt;LLM Stats (WideSearch): 76.4 (#3/9)&lt;/li&gt;&lt;li&gt;LLM Stats (Claw-Eval): 68.5 (#4/13)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSearchQA): 91.0 (#4/8)&lt;/li&gt;&lt;li&gt;LLM Stats (MathArena Apex): 38.7 (#4/7)&lt;/li&gt;&lt;li&gt;LLM Stats (NL2Repo): 45.6 (#4/12)&lt;/li&gt;&lt;li&gt;LLM Stats (APEX-Agents): 25.6 (#7/7)&lt;/li&gt;&lt;li&gt;LLM Stats (MCP Atlas): 79.1 (#7/30)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 71.7 (#9/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash&lt;/strong&gt; — ELO 2180, #66&lt;ul&gt;&lt;li&gt;Lean AI Formalization Leaderboard: 3.0 (#14/41)&lt;/li&gt;&lt;li&gt;Android Bench: 54.7 (#19/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Pro&lt;/strong&gt; — ELO 2146, #76&lt;ul&gt;&lt;li&gt;Creative Writing (Lechmazur): -0.6 (#25/38)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 Plus&lt;/strong&gt; — ELO 2139, #81&lt;ul&gt;&lt;li&gt;FutureEval: 7.53 (#25/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;inkling&lt;/strong&gt; — ELO 2118, #94&lt;ul&gt;&lt;li&gt;Vals AI CorpFin v2: 68.57 (#4/123)&lt;/li&gt;&lt;li&gt;Vals AI MedScribe: 85.41 (#12/72)&lt;/li&gt;&lt;li&gt;Vals AI CyberBench: 64.14 (#12/17)&lt;/li&gt;&lt;li&gt;Vals AI SkillsBench: 26.09 (#13/13)&lt;/li&gt;&lt;li&gt;Vals AI Public Benefits Bench: 58.46 (#14/19)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 2.08 (#14/24)&lt;/li&gt;&lt;li&gt;Vals AI TaxEval v2: 75.31 (#15/129)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 28.36 (#15/24)&lt;/li&gt;&lt;li&gt;Vals AI Finance Agent v2: 46.6 (#17/37)&lt;/li&gt;&lt;li&gt;Vals AI SWE-bench Verified: 77.6 (#20/72)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.5&lt;/strong&gt; — ELO 2110, #96&lt;ul&gt;&lt;li&gt;Creative Writing (Lechmazur): -0.5 (#23/38)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Max&lt;/strong&gt; — ELO 2104, #99&lt;ul&gt;&lt;li&gt;FutureEval: 0.12 (#58/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4&lt;/strong&gt; — ELO 2103, #100&lt;ul&gt;&lt;li&gt;FutureEval: 4.13 (#40/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash Lite&lt;/strong&gt; — ELO 2071, #114&lt;ul&gt;&lt;li&gt;FutureEval: 3.99 (#41/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4&lt;/strong&gt; — ELO 2047, #118&lt;ul&gt;&lt;li&gt;FutureEval: 0.06 (#59/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Mini&lt;/strong&gt; — ELO 2045, #119&lt;ul&gt;&lt;li&gt;FutureEval: 0.83 (#56/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O4 Mini&lt;/strong&gt; — ELO 2035, #123&lt;ul&gt;&lt;li&gt;FutureEval: 3.12 (#44/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.1 Fast&lt;/strong&gt; — ELO 2023, #130&lt;ul&gt;&lt;li&gt;FutureEval: 0.21 (#57/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KAT Coder Pro V2&lt;/strong&gt; — ELO 2019, #133&lt;ul&gt;&lt;li&gt;AA GDPval: 908.18 (#79/157)&lt;/li&gt;&lt;li&gt;GDPval-AA: 908.0 (#83/162)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.20&lt;/strong&gt; — ELO 2014, #135&lt;ul&gt;&lt;li&gt;HieroglyphBench: 16.8 (#13/19)&lt;/li&gt;&lt;li&gt;FrontierMath - Tier 4 (v2): 17.07 (#26/40)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 44.91 (#29/38)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mercury 2&lt;/strong&gt; — ELO 2003, #140&lt;ul&gt;&lt;li&gt;AA GDPval: 688.89 (#99/157)&lt;/li&gt;&lt;li&gt;GDPval-AA: 689.0 (#103/162)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2&lt;/strong&gt; — ELO 1991, #147&lt;ul&gt;&lt;li&gt;FutureEval: 0.97 (#55/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Max (Preview)&lt;/strong&gt; — ELO 1979, #154&lt;ul&gt;&lt;li&gt;Creative Writing (Lechmazur): 0.0 (#20/38)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2&lt;/strong&gt; — ELO 1957, #167&lt;ul&gt;&lt;li&gt;Creative Writing (Lechmazur): -2.3 (#34/38)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash&lt;/strong&gt; — ELO 1954, #168&lt;ul&gt;&lt;li&gt;FutureEval: -8.3 (#73/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1&lt;/strong&gt; — ELO 1944, #173&lt;ul&gt;&lt;li&gt;FutureEval: 3.02 (#45/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Sonnet (20240620)&lt;/strong&gt; — ELO 1931, #178&lt;ul&gt;&lt;li&gt;FutureEval: -2.47 (#66/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 3 Mini&lt;/strong&gt; — ELO 1931, #179&lt;ul&gt;&lt;li&gt;FutureEval: 1.95 (#51/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Mini&lt;/strong&gt; — ELO 1918, #189&lt;ul&gt;&lt;li&gt;FutureEval: -9.43 (#75/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.1&lt;/strong&gt; — ELO 1916, #194&lt;ul&gt;&lt;li&gt;FutureEval: 2.37 (#47/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.5&lt;/strong&gt; — ELO 1913, #198&lt;ul&gt;&lt;li&gt;FutureEval: -4.74 (#68/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 31B&lt;/strong&gt; — ELO 1899, #205&lt;ul&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 66.4 (#5/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1&lt;/strong&gt; — ELO 1862, #237&lt;ul&gt;&lt;li&gt;FutureEval: -0.37 (#61/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-OSS-120B&lt;/strong&gt; — ELO 1855, #241&lt;ul&gt;&lt;li&gt;FutureEval: -0.72 (#62/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Haiku 4.5&lt;/strong&gt; — ELO 1851, #244&lt;ul&gt;&lt;li&gt;FutureEval: 3.25 (#43/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 3&lt;/strong&gt; — ELO 1842, #250&lt;ul&gt;&lt;li&gt;FutureEval: 1.59 (#53/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 3&lt;/strong&gt; — ELO 1832, #258&lt;ul&gt;&lt;li&gt;Chatbot Arena (Vision): 1203.0 (#60/135)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3&lt;/strong&gt; — ELO 1815, #265&lt;ul&gt;&lt;li&gt;FutureEval: -5.35 (#69/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.7 Sonnet&lt;/strong&gt; — ELO 1792, #281&lt;ul&gt;&lt;li&gt;FutureEval: -2.36 (#65/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 Nemotron Ultra 253B v1&lt;/strong&gt; — ELO 1788, #282&lt;ul&gt;&lt;li&gt;FutureEval: -10.7 (#76/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Sonnet&lt;/strong&gt; — ELO 1782, #286&lt;ul&gt;&lt;li&gt;FutureEval: 3.59 (#42/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 Mini&lt;/strong&gt; — ELO 1761, #308&lt;ul&gt;&lt;li&gt;FutureEval: -1.4 (#63/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.0 Flash&lt;/strong&gt; — ELO 1759, #312&lt;ul&gt;&lt;li&gt;Design Arena (Video Editing): 1417.0 (#1/15)&lt;/li&gt;&lt;li&gt;FutureEval: 4.18 (#37/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Nano&lt;/strong&gt; — ELO 1754, #319&lt;ul&gt;&lt;li&gt;FutureEval: -6.06 (#71/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna XS.2&lt;/strong&gt; — ELO 1747, #322&lt;ul&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 0.0 (#24/24)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 0.96 (#24/24)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o Mini&lt;/strong&gt; — ELO 1688, #378&lt;ul&gt;&lt;li&gt;FutureEval: -8.97 (#74/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 4 Maverick&lt;/strong&gt; — ELO 1680, #383&lt;ul&gt;&lt;li&gt;FutureEval: -5.36 (#70/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna M.1&lt;/strong&gt; — ELO 1642, #421&lt;ul&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 0.0 (#20/24)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 2.4 (#23/24)&lt;/li&gt;&lt;li&gt;Vals AI Finance Agent v2: 25.03 (#36/37)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 Max&lt;/strong&gt; — ELO 1625, #440&lt;ul&gt;&lt;li&gt;FutureEval: -3.83 (#67/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 26B A4B&lt;/strong&gt; — ELO 1624, #442&lt;ul&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 44.1 (#7/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 27B&lt;/strong&gt; — ELO 1613, #452&lt;ul&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 13.5 (#19/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 12B&lt;/strong&gt; — ELO 1605, #463&lt;ul&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 43.4 (#8/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 Nano&lt;/strong&gt; — ELO 1458, #699&lt;ul&gt;&lt;li&gt;FutureEval: -18.82 (#77/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E4B&lt;/strong&gt; — ELO 1316, #1050&lt;ul&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 25.4 (#15/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E2B&lt;/strong&gt; — ELO 1115, #1314&lt;ul&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 19.1 (#17/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (120)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Arabic Broad Leaderboard: 8.217 (#40)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SvelteBench: 100.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; on Android Bench: 72.4 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; on BridgeBench Security: 1001.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; on SvelteBench: 100.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Pro Sol&lt;/strong&gt; on Arabic Broad Leaderboard: 8.97 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy: 91.21 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Maths: 92.86 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Primary: 94.37 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Science: 92.35 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Secondary: 90.09 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Social studies: 90.91 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Technology: 88.68 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education SEND: 87.61 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Reasoning: 84.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Reasoning - match (figure): 77.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Reasoning - pattern completion (2d): 82.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Reasoning - reasoning by analogy: 86.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Agent Security League - Functional Correctness: 70.9 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Agent Security League - Security Correctness: 23.5 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Agents' Last Exam: 30.6 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Benchmarks.bio - BioSecBench-Refusal: 39.5 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Blueprint-Bench 2: 0.336 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CADGenBench: 0.4108 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Clerk LLM Leaderboard: 80.5 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on DeepSWE: 72.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on EQ-Bench Longform Writing: 81.7 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on HieroglyphBench: 27.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Kaggle Game Arena Poker (Heads Up): 36.05 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (BrowseComp): 90.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (GDPval-AA): 1747.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (HealthBench Hard): 33.1 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (HealthBench Professional): 60.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (HealthBench): 57.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (Toolathlon): 58.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on React Native Evals: 86.34 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ZeroEval GPQA Diamond: 94.6 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA APEX-Agents: 41.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA CritPt: 23.43 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA GDPval: 1683.65 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA GPQA Diamond: 93.54 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Humanity's Last Exam: 44.35 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Long Context Reasoning: 74.67 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA MMMU-Pro: 80.52 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience: 18.42 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Business: 38.8 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Health: 37.5 (#44)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 43.8 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Law: 37.7 (#33)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 47.8 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 70.1 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - C: 87.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Dart: 62.0 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Go: 56.0 (#48)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - HTML: 76.0 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Java: 53.0 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - JavaScript: 77.27 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Julia: 48.0 (#47)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Kotlin: 66.0 (#28)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - PHP: 78.0 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Python: 70.0 (#33)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - R: 62.0 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Rust: 74.0 (#43)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Swift: 80.0 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - TypeScript: 74.44 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA SciCode: 58.68 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA-Omniscience Accuracy: 45.95 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI Chess Leaderboard (Continuation): 1351.0 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI Chess Leaderboard (Reasoning): 1518.0 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Arabic Broad Leaderboard: 8.906 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Artificial Analysis Intelligence Index: 57.11 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on BridgeBench Debugging: 1066.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on BridgeBench Hallucination: 1030.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on BridgeBench Refactoring: 1065.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on BridgeBench Security: 1023.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Bullshit Benchmark: 58.2 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Chatbot Arena (Text): 1486.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on DeepSWE: 68.5 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on EQ-Bench Longform Writing: 79.6 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on GDPval-AA: 1684.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on HieroglyphBench: 25.9 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on KernelBench Hub - Mega: 18.09 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on KernelBench Hub - Mega: 18.09 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (CharXiv-R): 91.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (FrontierSWE): 81.2 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (GDPval-AA): 1668.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (MCP Atlas): 84.2 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (OfficeQA Pro): 63.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (Terminal-Bench 2.1): 88.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (Toolathlon): 73.2 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (ZEROBench): 41.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on PM-LLM-Benchmark: 39.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on RuneBench: 1891.0 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Surface Evolver Bench: 95.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Surface Evolver Bench Pass Rate: 87.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SvelteBench: 95.6 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI (Vals Index): 74.7 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI CorpFin v2: 71.56 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI CyberBench: 79.03 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Excel Modeling: 66.4 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Finance Agent v2: 54.36 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI GPQA: 92.93 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Harvey Legal Agent Bench: 10.83 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Legal Research Bench: 44.23 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI LegalBench: 86.02 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI LiveCodeBench: 87.19 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI MMLU-Pro: 87.97 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI MMMU: 88.15 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI MedCode: 48.88 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI MedScribe: 87.96 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI MortgageTax: 66.34 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Multimodal Index: 73.42 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI ProofBench: 70.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI SAGE: 54.26 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI SWE-bench Verified: 93.4 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI TaxEval v2: 75.72 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 80.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Vibe Code Bench: 84.96 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on You're Absolutely Right!: 3.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on ZeroEval GPQA Diamond: 93.5 (#7)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (49)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;ExploitGym&lt;/strong&gt;: GPT-5.6 Sol (293.0) beat Claude Mythos Preview by 136.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GeoBench Photos&lt;/strong&gt;: Claude Fable 5 (4313.64) beat Gemini 3 Flash (Preview) by 109.38&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Video Editing)&lt;/strong&gt;: Gemini 2.0 Flash (1417.0) beat happy-horse-1.0 by 99.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MineBench&lt;/strong&gt;: GPT-5.6 Sol (2108.79) beat GPT-5.5 Pro by 73.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GeoBench ACW&lt;/strong&gt;: Claude Fable 5 (4403.7) beat Gemini 3 Flash (Preview) by 70.93&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (3D)&lt;/strong&gt;: Kimi K3 (1441.0) beat GLM-5.2 by 70.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Data Viz)&lt;/strong&gt;: Kimi K3 (1429.0) beat Claude Fable 5 by 57.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GDP.pdf&lt;/strong&gt;: Claude Fable 5 (Thinking, Max) (70.3) beat GPT-5.6 Sol by 39.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Code)&lt;/strong&gt;: Kimi K3 (1679.0) beat Claude Fable 5 by 30.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - SpatialBench-Long&lt;/strong&gt;: GPT-5.6 Sol (38.89) beat Gemini 3.5 Flash by 27.78&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ClockBench&lt;/strong&gt;: GPT-5.6 Sol (Max) (66.7) beat GPT-5.4 (High) by 16.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Toolathlon)&lt;/strong&gt;: Muse Spark 1.1 (75.6) beat Claude Opus 4.8 by 15.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (MRCR v2 (8-needle))&lt;/strong&gt;: GPT-5.6 Sol (91.5) beat Claude Opus 4.6 by 15.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (BabyVision)&lt;/strong&gt;: Kimi K3 (85.7) beat Seed 2.1 Pro by 12.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - match (process)&lt;/strong&gt;: GPT-5.6 Sol (88.9) beat Gemini 3 Flash by 11.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Graphwalks BFS &gt;128k)&lt;/strong&gt;: GPT-5.6 Sol (90.7) beat Claude Mythos Preview by 10.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Android Bench&lt;/strong&gt;: Claude Fable 5 (84.5) beat GPT-5.5 by 10.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - odd one out&lt;/strong&gt;: GPT-5.6 Sol (88.3) beat Gemini 3.5 Flash by 7.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Lean AI Formalization Leaderboard&lt;/strong&gt;: Seed Prover (ByteDance) (129.0) beat Aristotle (Harmonic) by 7.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ARC-AGI-3&lt;/strong&gt;: GPT-5.6 Sol (Max) (7.78) beat Claude Opus 4.8 (High) by 6.26&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TrackingAI IQ Test (Offline)&lt;/strong&gt;: GPT-Terra-Ultra (87.5) beat GPT-5 Pro by 6.25&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Website)&lt;/strong&gt;: GPT-5.6 Sol (1352.0) beat GLM-5.2 by 6.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AgenticVBench&lt;/strong&gt;: GPT-5.6 Sol (38.4) beat Claude Fable 5 by 6.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Terminal-Bench 2.1)&lt;/strong&gt;: GPT-5.6 Sol (88.8) beat Claude Fable 5 by 4.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (MCP Atlas)&lt;/strong&gt;: Muse Spark 1.1 (88.1) beat Seed 2.1 Pro by 4.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TaxCalcBench&lt;/strong&gt;: GPT-5.6 Sol Web Search (58.0) beat GPT-5.5 Web Search by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (APEX-Agents)&lt;/strong&gt;: Kimi K3 (37.6) beat Seed 2.1 Pro by 3.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldArena Track 1 - Motion Quality&lt;/strong&gt;: AccioWM (93.29) beat SUSWM by 3.53&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (MathVision)&lt;/strong&gt;: Kimi K3 (97.8) beat Seed 2.1 Pro by 3.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WeirdML&lt;/strong&gt;: Claude Fable 5 (Max) (91.94) beat GPT-5.6 Sol (High) by 3.18&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - AudioMultiChallenge&lt;/strong&gt;: Inkling (Thinking) (56.64) beat Gemini 3 Pro (Preview) (Thinking) by 1.99&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - AudioMultiChallenge - Text Output&lt;/strong&gt;: Inkling (Thinking) (56.64) beat Gemini 3 Pro (Preview) (Thinking) by 1.99&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (DeepSearchQA)&lt;/strong&gt;: Kimi K3 (95.0) beat Claude Opus 4.8 by 1.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Dynamic&lt;/strong&gt;: WorldScape-0.2(MoE) (76.23) beat World Dreamer by 1.88&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Legal Research Bench&lt;/strong&gt;: Claude Fable 5 (49.52) beat GPT-5.6 Sol by 1.44&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldArena Track 1&lt;/strong&gt;: UNIS (73.64) beat PAIWorld by 1.33&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Excel Modeling&lt;/strong&gt;: Claude Fable 5 (73.67) beat GPT-5.6 Sol by 1.33&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore&lt;/strong&gt;: WorldScape-0.2(MoE) (80.68) beat World Dreamer by 1.24&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (BrowseComp)&lt;/strong&gt;: Kimi K3 (91.2) beat GPT-5.5 Pro by 1.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - pattern completion (linear)&lt;/strong&gt;: GPT-5.6 Sol (92.3) beat Gemini 3.5 Flash by 0.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldArena Track 1 - Controllability&lt;/strong&gt;: UNIS (91.6) beat ABot-PhysWorld (text) by 0.76&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Terminal-Bench 2.1 (Claude Code)&lt;/strong&gt;: Claude Fable 5 (83.8) beat Claude 5 Fable by 0.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Static&lt;/strong&gt;: WorldScape-0.2(MoE) (85.13) beat World Dreamer by 0.61&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Tau3 Banking&lt;/strong&gt;: Kimi K3 (33.4) beat GPT-5.6 Sol (Max) by 0.41&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Terminal-Bench 2.1&lt;/strong&gt;: Claude Fable 5 (83.8) beat GPT-5.5 by 0.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Confirmed Success&lt;/strong&gt;: Claude Fable 5 (High) (17.27) beat MiniMax-M2.7 by 0.15&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMEB Leaderboard&lt;/strong&gt;: DME-Large (80.24) beat octen-vl-embedding-large by 0.15&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Public Benefits Bench&lt;/strong&gt;: Kimi K3 (68.27) beat Claude Opus 4.8 by 0.14&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CADGenBench&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (0.5319) beat GPT-5.5 (xHigh) by 0.07&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-19

=== DAILY ===
NEW BENCHMARKS (9)
  - SCALE SQL Understanding (Ability Score (%)): leader Gemini 3 Pro (86.0), 35 models
  - SCALE SQL Dialect Conversion (Ability Score (%)): leader Qwen 3.7 Max (77.3), 35 models
  - SCALE SQL Optimization (Ability Score (%)): leade</summary></entry><entry><title>The Aggregate Digest — 2026-07-18</title><id>https://theaggregate.ai/digest/2026-07-18</id><updated>2026-07-18T06:23:38.281963+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (10)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Sense Ruby Navigation - Baseline&lt;/strong&gt; (Mean cited recall across repositories (%)): leader GPT-5.5 (71.46), 5 models&lt;br&gt;&lt;span&gt;Sense Ruby Navigation measures how completely coding agents locate must-find code across 13 pinned Ruby and Rails repositories; this board averages exact path-and-line cited recall for the normal-tools baseline arm.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SciDiagramEdit - Semantic Faithfulness&lt;/strong&gt; (No-skill pairwise win rate (%)): leader GPT-5.5 (74.5), 4 models&lt;br&gt;&lt;span&gt;SciDiagramEdit measures instruction-driven editing of scientific figures reconstructed from real paper revision pairs; this board reports blind pairwise semantic-faithfulness win rate for the unassisted model backbones.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SciDiagramEdit - Aesthetic Preference&lt;/strong&gt; (No-skill pairwise win rate (%)): leader GPT-5.5 (46.6), 4 models&lt;br&gt;&lt;span&gt;SciDiagramEdit measures instruction-driven editing of scientific figures reconstructed from real paper revision pairs; this board reports blind pairwise aesthetic preference for the unassisted model backbones.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SVLAT - Overall&lt;/strong&gt; (Accuracy (%)): leader Gemini 3.1 Pro (Preview) (88.57), 6 models&lt;br&gt;&lt;span&gt;Scientific Visualization Literacy Assessment Test (SVLAT) evaluates reading and reasoning over static and animated scientific visualizations; overall accuracy is averaged across the authors\&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SVLAT - Image&lt;/strong&gt; (Accuracy (%)): leader Gemini 3.1 Pro (Preview) (90.86), 6 models&lt;br&gt;&lt;span&gt;Scientific Visualization Literacy Assessment Test (SVLAT) multiple-choice questions about static scientific visualizations; accuracy is averaged across the authors\&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SVLAT - Animation&lt;/strong&gt; (Accuracy (%)): leader Gemini 3.1 Pro (Preview) (82.86), 6 models&lt;br&gt;&lt;span&gt;Scientific Visualization Literacy Assessment Test (SVLAT) multiple-choice questions about animated scientific visualizations; accuracy is averaged across the authors\&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Semgrep IDOR - Multimodal F1&lt;/strong&gt; (F1 score (%)): leader GPT-5.6 Sol (61.7), 6 models&lt;br&gt;&lt;span&gt;Semgrep researcher-reviewed benchmark of insecure direct object reference detection in representative production applications over ten runs, using the Semgrep Multimodal security workflow and reporting F1.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Semgrep IDOR - Guided Prompt F1&lt;/strong&gt; (F1 score (%)): leader GPT-5.6 Sol (38.9), 5 models&lt;br&gt;&lt;span&gt;Semgrep researcher-reviewed benchmark of insecure direct object reference detection in representative production applications over ten runs, using each LLM alone with a guided prompt and reporting F1.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Frontier Security Agents - Cybench Hard&lt;/strong&gt; (Success rate (%)): leader GPT-5.5 (94.1), 8 models&lt;br&gt;&lt;span&gt;Cybench hard-variant offensive-security evaluation of agents solving capture-the-flag challenges, reporting raw success rate at each model\&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Frontier Security Agents - BOTS v1&lt;/strong&gt; (BOTS score (%)): leader Claude Opus 4.8 (93.9), 8 models&lt;br&gt;&lt;span&gt;BOTS v1 defensive-security agent evaluation on scored SOC investigation questions in Splunk, reporting official point-weighted score at each model\&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; — ELO 2630, #11&lt;ul&gt;&lt;li&gt;EQ-Bench Longform Writing: 72.5 (#22/123)&lt;/li&gt;&lt;li&gt;RuneBench: 1590.0 (#24/33)&lt;/li&gt;&lt;li&gt;ARC-AGI-2: 36.53 (#47/166)&lt;/li&gt;&lt;li&gt;ARC-AGI-1: 79.5 (#48/164)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (35)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; on BridgeBench Security: 1001.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy: 91.21 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Maths: 92.86 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Primary: 94.37 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Science: 92.35 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Secondary: 90.09 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Social studies: 90.91 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Pedagogy - Technology: 88.68 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education SEND: 87.61 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Reasoning: 84.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Reasoning - match (figure): 77.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Reasoning - pattern completion (2d): 82.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Reasoning - reasoning by analogy: 86.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Agent Security League - Functional Correctness: 70.9 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Agent Security League - Security Correctness: 23.5 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; on ARC-AGI-1: 79.5 (#48)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; on ARC-AGI-2: 36.53 (#47)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; on EQ-Bench Longform Writing: 72.5 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; on RuneBench: 1590.0 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; on SvelteBench: 87.8 (#76)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on BridgeBench Debugging: 1066.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on BridgeBench Hallucination: 1030.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on BridgeBench Refactoring: 1065.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on BridgeBench Security: 1023.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on DeepSWE: 68.5 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on EQ-Bench Longform Writing: 79.6 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on RuneBench: 1891.0 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Surface Evolver Bench: 95.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Surface Evolver Bench Pass Rate: 87.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI CyberBench: 79.03 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Excel Modeling: 66.4 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Finance Agent v2: 54.36 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI ProofBench: 70.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI SWE-bench Verified: 93.4 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Vibe Code Bench: 71.06 (#8)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;ExploitGym&lt;/strong&gt;: GPT-5.6 Sol (293.0) beat Claude Mythos Preview by 136.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - match (process)&lt;/strong&gt;: GPT-5.6 Sol (88.9) beat Gemini 3 Flash by 11.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - odd one out&lt;/strong&gt;: GPT-5.6 Sol (88.3) beat Gemini 3.5 Flash by 7.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (MCP Atlas)&lt;/strong&gt;: Muse Spark 1.1 (88.1) beat Kimi K3 by 3.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Toolathlon)&lt;/strong&gt;: Muse Spark 1.1 (75.6) beat Kimi K3 by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - pattern completion (linear)&lt;/strong&gt;: GPT-5.6 Sol (92.3) beat Gemini 3.5 Flash by 0.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Terminal-Bench 2.1 (Claude Code)&lt;/strong&gt;: Claude Fable 5 (83.8) beat Claude 5 Fable by 0.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Terminal-Bench 2.1&lt;/strong&gt;: Claude Fable 5 (83.8) beat GPT-5.5 by 0.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CADGenBench&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (0.5319) beat Archie in Forge by 0.02&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-18

=== DAILY ===
NEW BENCHMARKS (10)
  - Sense Ruby Navigation - Baseline (Mean cited recall across repositories (%)): leader GPT-5.5 (71.46), 5 models
      Sense Ruby Navigation measures how completely coding agents locate must-find code across 13 pinned Ruby and Ra</summary></entry><entry><title>The Aggregate Digest — 2026-07-17</title><id>https://theaggregate.ai/digest/2026-07-17</id><updated>2026-07-17T08:41:26.430027+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - BioSecBench-Surveillance&lt;/strong&gt; (Pass Rate (%)): leader Grok 4.5 (53.3), 15 models&lt;br&gt;&lt;span&gt;BioSecBench-Surveillance (benchmarks.bio) — biosurveillance analysis over pathogen genomic samples (isolates, wastewater, clinical, air): variant detection, taxonomic classification, antimicrobial-resistance and toxin characterization, and source tracking, scored as pass rate.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - VariantBench&lt;/strong&gt; (Pass Rate (%)): leader GPT-5.6 Sol (42.1), 11 models&lt;br&gt;&lt;span&gt;VariantBench (benchmarks.bio) — agentic genetic-variant discovery and interpretation over real sequencing data (short- and long-read WGS and exome across Illumina, PacBio and ONT): small-variant, structural-variant and repeat calling with QC, statistical and population genomics, and clinical/personal genome interpretation, scored as pass rate with deterministic grading.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (PostTrainBench)&lt;/strong&gt; (Score (%)): leader MiniMax-M3 (37.1), 5 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Program Bench)&lt;/strong&gt; (Score (%)): leader Kimi K3 (77.8), 5 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (WorldVQA)&lt;/strong&gt; (Score (%)): leader Qwen 3.7 Plus (61.1), 5 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Long-Horizon Terminal-Bench&lt;/strong&gt; (Mean Score (%)): leader Grok 4.5 (50.5), 21 models&lt;br&gt;&lt;span&gt;Long-Horizon Terminal-Bench (LHTB) — coding and research agent tasks in a real terminal that unfold over hundreds of steps, graded by dense per-step reward rather than single pass/fail; headline is the mean reward across tasks (0-100).&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Visual Acuity Test (4K)&lt;/strong&gt; (Mean Accuracy (%)): leader GPT-5.4 (100.0), 30 models&lt;br&gt;&lt;span&gt;Visual Acuity Test for LLMs — reading text rendered at progressively smaller sizes inside a 4K image; measures how small a model can still read as mean character accuracy, taking each model&amp;#x27;s best detail/resolution setting.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RadLE 2.0 (Radiology)&lt;/strong&gt; (RadLE Score): leader Claude Fable 5 (758.0), 16 models&lt;br&gt;&lt;span&gt;RadLE 2.0 (crashlab.in) — radiology visual-reasoning cases pitting vision-language models against board-certified radiologists and trainees; models earn an Elo-style RadLE score (human experts sit near 989).&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;HumainE Leaderboard&lt;/strong&gt; (HumainE Score): leader Gemini 3.1 Pro (Preview) (35.38), 54 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; — ELO 2974, #7&lt;ul&gt;&lt;li&gt;Chatbot Arena (Code): 1679.0 (#1/98)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 33.4 (#1/157)&lt;/li&gt;&lt;li&gt;LLM Stats (APEX-Agents): 37.6 (#1/7)&lt;/li&gt;&lt;li&gt;LLM Stats (AutomationBench): 30.8 (#1/6)&lt;/li&gt;&lt;li&gt;LLM Stats (BabyVision): 85.7 (#1/8)&lt;/li&gt;&lt;li&gt;LLM Stats (BrowseComp): 91.2 (#1/57)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSearchQA): 95.0 (#1/8)&lt;/li&gt;&lt;li&gt;LLM Stats (MathVision): 97.8 (#1/32)&lt;/li&gt;&lt;li&gt;LLM Stats (MCP Atlas): 84.2 (#1/29)&lt;/li&gt;&lt;li&gt;LLM Stats (Toolathlon): 73.2 (#1/29)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (58)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Blueprint-Bench 2: 0.336 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CADGenBench: 0.4108 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on HieroglyphBench: 27.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on React Native Evals: 86.34 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; on Chatbot Arena (Code): 1434.0 (#38)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; on Chatbot Arena (Text): 1441.0 (#67)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; on Vals AI (Vals Index): 49.28 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 47.57 (#34)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA CritPt: 23.43 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA GDPval: 1668.08 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA GPQA Diamond: 93.54 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Humanity's Last Exam: 44.35 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Long Context Reasoning: 74.67 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA MMMU-Pro: 80.52 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience: 18.42 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Business: 38.8 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Health: 37.5 (#44)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 43.8 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Law: 37.7 (#33)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 47.8 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 70.1 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - C: 87.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Dart: 62.0 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Go: 56.0 (#48)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - HTML: 76.0 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Java: 53.0 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - JavaScript: 77.27 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Julia: 48.0 (#47)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Kotlin: 66.0 (#28)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - PHP: 78.0 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Python: 70.0 (#33)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - R: 62.0 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Rust: 74.0 (#43)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Swift: 80.0 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - TypeScript: 74.44 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA SciCode: 58.68 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA-Omniscience Accuracy: 45.95 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI Chess Leaderboard (Continuation): 1800.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI Chess Leaderboard (Reasoning): 1522.0 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Artificial Analysis Intelligence Index: 57.11 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Bullshit Benchmark: 58.2 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Chatbot Arena (Text): 1486.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on GDPval-AA: 1668.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (CharXiv-R): 91.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (DeepSWE): 67.5 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (FrontierSWE): 81.2 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (GDPval-AA): 1668.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (OfficeQA Pro): 63.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (Terminal-Bench 2.1): 88.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LLM Stats (ZEROBench): 41.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on PM-LLM-Benchmark: 39.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on PinchBench: 30.25 (#58)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SvelteBench: 95.6 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI (Vals Index): 74.7 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI CorpFin v2: 71.56 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI MedCode: 48.88 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 80.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on ZeroEval GPQA Diamond: 93.5 (#7)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (14)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Code)&lt;/strong&gt;: Kimi K3 (1679.0) beat GPT-5.6 Sol (xHigh) by 48.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ClockBench&lt;/strong&gt;: GPT-5.6 Sol (Max) (66.7) beat GPT-5.4 (High) by 16.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Toolathlon)&lt;/strong&gt;: Kimi K3 (73.2) beat Claude Opus 4.8 by 13.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (AutomationBench)&lt;/strong&gt;: Kimi K3 (30.8) beat GPT-5.6 Sol by 12.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (BabyVision)&lt;/strong&gt;: Kimi K3 (85.7) beat Seed 2.1 Pro by 12.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TrackingAI IQ Test (Offline)&lt;/strong&gt;: GPT-Sol-Ultra (87.5) beat GPT-5 Pro by 6.25&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AgenticVBench&lt;/strong&gt;: GPT-5.6 Sol (38.4) beat Claude Fable 5 by 6.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (APEX-Agents)&lt;/strong&gt;: Kimi K3 (37.6) beat Seed 2.1 Pro by 3.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (MathVision)&lt;/strong&gt;: Kimi K3 (97.8) beat Seed 2.1 Pro by 3.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (DeepSearchQA)&lt;/strong&gt;: Kimi K3 (95.0) beat Claude Opus 4.8 by 1.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (BrowseComp)&lt;/strong&gt;: Kimi K3 (91.2) beat GPT-5.6 Sol by 0.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Tau3 Banking&lt;/strong&gt;: Kimi K3 (33.4) beat GPT-5.6 Sol (Max) by 0.41&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (MCP Atlas)&lt;/strong&gt;: Kimi K3 (84.2) beat Seed 2.1 Pro by 0.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CADGenBench&lt;/strong&gt;: Archie in Forge (0.5073) beat GPT-5.5 (xHigh) by 0.05&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-17

=== DAILY ===
NEW BENCHMARKS (9)
  - Benchmarks.bio - BioSecBench-Surveillance (Pass Rate (%)): leader Grok 4.5 (53.3), 15 models
      BioSecBench-Surveillance (benchmarks.bio) — biosurveillance analysis over pathogen genomic samples (isolates, wastewater, clinica</summary></entry><entry><title>The Aggregate Digest — 2026-07-16</title><id>https://theaggregate.ai/digest/2026-07-16</id><updated>2026-07-16T06:33:00.266162+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Blueprint Bench 2&lt;/strong&gt; (Score): leader claude-fable-5_unknown (38.61), 17 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Proofbench&lt;/strong&gt; (Score): leader gpt-5.6-sol_max (77.0), 43 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Enigma Eval&lt;/strong&gt; (Score): leader gpt-5.4-pro-2026-03-05_unknown (23.82), 42 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; — ELO 2701, #10&lt;ul&gt;&lt;li&gt;SEAL - AudioMultiChallenge: 56.64 (#1/32)&lt;/li&gt;&lt;li&gt;SEAL - AudioMultiChallenge - Text Output: 56.64 (#1/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SvelteBench: 100.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; on SvelteBench: 100.0 (#4)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GDP.pdf&lt;/strong&gt;: Claude Fable 5 (Thinking, Max) (70.3) beat GPT-5.6 Sol by 39.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - AudioMultiChallenge&lt;/strong&gt;: Inkling (56.64) beat Gemini 3 Pro (Preview) (Thinking) by 1.99&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - AudioMultiChallenge - Text Output&lt;/strong&gt;: Inkling (56.64) beat Gemini 3 Pro (Preview) (Thinking) by 1.99&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-16

=== DAILY ===
NEW BENCHMARKS (3)
  - Epoch AI - Blueprint Bench 2 (Score): leader claude-fable-5_unknown (38.61), 17 models
  - Epoch AI - Proofbench (Score): leader gpt-5.6-sol_max (77.0), 43 models
  - Epoch AI - Enigma Eval (Score): leader gpt-5.4-pro-2026-03-05</summary></entry><entry><title>The Aggregate Digest — 2026-07-15</title><id>https://theaggregate.ai/digest/2026-07-15</id><updated>2026-07-15T06:25:04.585596+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;Top-10 New Scores (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Arabic Broad Leaderboard: 8.217 (#38)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; on Android Bench: 72.4 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Benchmarks.bio - BioSecBench-Refusal: 39.5 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Clerk LLM Leaderboard: 80.5 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on EQ-Bench Longform Writing: 81.7 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; on Android Bench: 54.2 (#20)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;MineBench&lt;/strong&gt;: GPT-5.6 Sol (2173.92) beat Claude Fable 5 by 118.26&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GeoBench Photos&lt;/strong&gt;: Claude Fable 5 (4313.64) beat Gemini 3 Flash (Preview) by 109.38&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GeoBench ACW&lt;/strong&gt;: Claude Fable 5 (4403.7) beat Gemini 3 Flash (Preview) by 70.93&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - SpatialBench-Long&lt;/strong&gt;: GPT-5.6 Sol (38.89) beat Gemini 3.5 Flash by 27.78&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Android Bench&lt;/strong&gt;: Claude Fable 5 (84.5) beat GPT-5.5 by 10.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ARC-AGI-3&lt;/strong&gt;: GPT-5.6 Sol (Max) (7.78) beat Claude Opus 4.8 (High) by 6.26&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Dynamic&lt;/strong&gt;: WorldScape-0.2(MoE) (76.23) beat World Dreamer by 1.88&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore&lt;/strong&gt;: WorldScape-0.2(MoE) (80.68) beat World Dreamer by 1.24&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Static&lt;/strong&gt;: WorldScape-0.2(MoE) (85.13) beat World Dreamer by 0.61&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-15

=== DAILY ===
NEW SCORES FROM TOP-10 MODELS (6)
  - Claude Fable 5 on Arabic Broad Leaderboard: 8.217 Average Score (0-10) (#38/102)
  - Claude Opus 4.8 on Android Bench: 72.4 Score (%) (#6/25)
  - GPT-5.6 Sol on Benchmarks.bio - BioSecBench-Refusal: 39.5 Pass Rate</summary></entry><entry><title>The Aggregate Digest — 2026-07-14</title><id>https://theaggregate.ai/digest/2026-07-14</id><updated>2026-07-14T06:21:36.836442+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;Top-10 New Scores (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Chatbot Arena (Search): 1234.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Kaggle Game Arena Poker (Heads Up): 36.05 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Mercor APEX: 37.1 (#8)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;TaxCalcBench&lt;/strong&gt;: GPT-5.6 Sol Web Search (58.0) beat GPT-5.5 Web Search by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldArena Track 1 - Motion Quality&lt;/strong&gt;: AccioWM (93.29) beat SUSWM by 3.53&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-14

=== DAILY ===
NEW SCORES FROM TOP-10 MODELS (3)
  - Claude Fable 5 on Chatbot Arena (Search): 1234.0 Arena Score (#4/32)
  - GPT-5.6 Sol on Kaggle Game Arena Poker (Heads Up): 36.05 Mean BB/100 (#2/24)
  - Muse Spark 1.1 on Mercor APEX: 37.1 Best Pass@1 (%) (#8/52)</summary></entry><entry><title>The Aggregate Digest — 2026-07-13</title><id>https://theaggregate.ai/digest/2026-07-13</id><updated>2026-07-13T07:01:39.955504+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Artificial Analysis)&lt;/strong&gt; (Score (%)): leader GPT-5.6 Sol (59.0), 5 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (AutomationBench)&lt;/strong&gt; (Score (%)): leader GPT-5.6 Sol (18.1), 5 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (DeepSWE)&lt;/strong&gt; (Score (%)): leader GPT-5.6 Sol (72.7), 7 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (GDP.pdf)&lt;/strong&gt; (Score (%)): leader Claude Sonnet 5 (81.6), 5 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (10)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Agents' Last Exam: 30.6 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on DeepSWE: 72.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (GDPval-AA): 1747.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (Graphwalks BFS &gt;128k): 77.1 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (HealthBench Hard): 33.1 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (HealthBench Professional): 60.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (HealthBench): 57.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (MRCR v2 (8-needle)): 73.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Stats (Toolathlon): 58.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ZeroEval GPQA Diamond: 94.6 (#1)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Video Editing)&lt;/strong&gt;: Gemini 2.0 Flash (1402.0) beat happy-horse-1.0 by 84.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Terminal-Bench 2.1)&lt;/strong&gt;: GPT-5.6 Sol (88.8) beat Claude Fable 5 by 4.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WeirdML&lt;/strong&gt;: Claude Fable 5 (Max) (91.94) beat GPT-5.6 Sol (High) by 3.18&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (BrowseComp)&lt;/strong&gt;: GPT-5.6 Sol (90.4) beat GPT-5.5 Pro by 0.3&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-13

=== DAILY ===
NEW BENCHMARKS (4)
  - LLM Stats (Artificial Analysis) (Score (%)): leader GPT-5.6 Sol (59.0), 5 models
  - LLM Stats (AutomationBench) (Score (%)): leader GPT-5.6 Sol (18.1), 5 models
  - LLM Stats (DeepSWE) (Score (%)): leader GPT-5.6 Sol (72.7), 7 </summary></entry><entry><title>The Aggregate Digest — 2026-07-12</title><id>https://theaggregate.ai/digest/2026-07-12</id><updated>2026-07-12T06:50:29.666855+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Language - Chat&lt;/strong&gt; (Score (%)): leader Doubao-Seed-2-0-Pro-260215 (high) (91.7), 23 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (10)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Lean AI Formalization Leaderboard: 4.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on TaxCalcBench: 26.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on TrackingAI IQ Test (Mensa Norway): 60.0 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on TrackingAI IQ Test (Vision): 78.57 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; on TaxCalcBench: 16.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (3D): 1370.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (Game Dev): 1378.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on TaxCalcBench: 26.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on VoxelBench: 2306.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.1 Pro&lt;/strong&gt; on BabyVision: 73.7 (#4)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;BabyVision&lt;/strong&gt;: GPT-5.5 (83.6) beat Seed 2.0 Pro (High) by 23.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (UI Components)&lt;/strong&gt;: GPT-5.6 Sol (1413.0) beat Claude Fable 5 by 7.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSO-Bench&lt;/strong&gt;: Claude Opus 4.8 (47.06) beat Claude Opus 4.7 by 2.94&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Open Universal Arabic ASR Leaderboard&lt;/strong&gt;: cohere-transcribe-arabic-07-2026 (25.87) beat omniASR_LLM_7B by 2.45&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AMA-Bench - Embodied AI&lt;/strong&gt;: VeraKV (Qwen3-32B) (58.09) beat GPT-5.2 by 1.65&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Open Universal Arabic ASR Leaderboard - CER&lt;/strong&gt;: cohere-transcribe-arabic-07-2026 (11.8) beat Qwen3-ASR-1.7B by 0.53&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Weekly&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (15)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Shader Benchmark&lt;/strong&gt; (Avg judge score (0-500, render fails count 0)): leader gpt-5.5-high (242.2), 3 models&lt;br&gt;&lt;span&gt;Shader Benchmark (nbardy) — generating shader programs from natural-language prompts, graded by an LLM judge panel with render failures counting as zero; average judge score (0-500).&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KINA&lt;/strong&gt; (Accuracy (%)): leader Gemini-3.1-Pro-Preview (53.17), 42 models&lt;br&gt;&lt;span&gt;KINA (Knowledge Index of Noah&amp;#x27;s Ark) — 899-item knowledge benchmark across 261 fine-grained disciplines with representativeness-aware sampling and tournament-audited annotation; overall accuracy.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Office Comprehension Bench&lt;/strong&gt; (Domain Q&amp;A Accuracy (%)): leader GPT-5.5 Thinking (59.35), 3 models&lt;br&gt;&lt;span&gt;Office Comprehension Bench (Microsoft) — Domain Q&amp;amp;A track: expert-level multi-step reasoning over native Word/Excel/PowerPoint files across 12 professional domains; assertion-level accuracy via LLM-judge ensemble.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OmniGameArena - ObstacleRun2D&lt;/strong&gt; (Normalized game score (%)): leader GPT-5.5 (47.3), 12 models&lt;br&gt;&lt;span&gt;The \&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OmniGameArena - ObstacleRun3D&lt;/strong&gt; (Normalized game score (%)): leader Claude Sonnet 4.6 (20.0), 12 models&lt;br&gt;&lt;span&gt;The \&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OmniGameArena - LastStand&lt;/strong&gt; (Normalized game score (%)): leader GPT-5.5 (41.6), 12 models&lt;br&gt;&lt;span&gt;The \&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OmniGameArena - MonsterShoot&lt;/strong&gt; (Normalized game score (%)): leader Gemini 3.1 Pro Preview (71.0), 12 models&lt;br&gt;&lt;span&gt;The \&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OmniGameArena - SceneEscape&lt;/strong&gt; (Normalized game score (%)): leader GPT-5.5 (72.0), 12 models&lt;br&gt;&lt;span&gt;The \&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OmniGameArena - CueChase&lt;/strong&gt; (Normalized game score (%)): leader Claude Opus 4.6 (84.0), 12 models&lt;br&gt;&lt;span&gt;The \&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OmniGameArena - SoloCraft&lt;/strong&gt; (Normalized game score (%)): leader GPT-5.5 (25.2), 12 models&lt;br&gt;&lt;span&gt;The \&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OmniGameArena - SharedFloor&lt;/strong&gt; (Normalized game score (%)): leader GPT-5.5 (36.8), 10 models&lt;br&gt;&lt;span&gt;The \&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OmniGameArena - HandoffRun&lt;/strong&gt; (Normalized game score (%)): leader GPT-5.5 (18.4), 10 models&lt;br&gt;&lt;span&gt;The \&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Poker Arena&lt;/strong&gt; (Tournament win rate (%)): leader Claude Opus 4.6 (19.4), 7 models&lt;br&gt;&lt;span&gt;Poker Arena (arXiv) — strategic reasoning, risk assessment and bluffing measured through head-to-head LLM poker tournaments; tournament win rate (%).&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ClawArena&lt;/strong&gt; (Composite Reliability Score): leader Claude Fable-5 (70.05), 20 models&lt;br&gt;&lt;span&gt;ClawArena (clawarena.cc) — reliability of LLM subagent orchestration under a Claw-style harness; Composite Reliability Score across scripted multi-agent runs.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Language - Chat&lt;/strong&gt; (Score (%)): leader Doubao-Seed-2-0-Pro-260215 (high) (91.7), 23 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (131)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; — ELO 3083, #6&lt;ul&gt;&lt;li&gt;Senior SWE-Bench: 29.1 (#1/10)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Mega: 18.7 (#2/12)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test (Vision): 78.57 (#3/19)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Hard: 24.0 (#4/13)&lt;/li&gt;&lt;li&gt;TaxCalcBench: 26.0 (#5/9)&lt;/li&gt;&lt;li&gt;Lean AI Formalization Leaderboard: 4.0 (#13/35)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test (Mensa Norway): 60.0 (#20/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; — ELO 2770, #8&lt;ul&gt;&lt;li&gt;GSO-Bench: 47.06 (#1/30)&lt;/li&gt;&lt;li&gt;TaxCalcBench: 16.0 (#7/9)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; — ELO 2766, #9&lt;ul&gt;&lt;li&gt;SEAL - MultiNRC: 65.59 (#1/44)&lt;/li&gt;&lt;li&gt;SEAL - VisualToolBench (VTB): 44.77 (#1/21)&lt;/li&gt;&lt;li&gt;SEAL - SWE-Bench Pro (Public Dataset): 61.5 (#1/25)&lt;/li&gt;&lt;li&gt;SEAL - SWE-Bench Pro (Private Dataset): 51.5 (#1/14)&lt;/li&gt;&lt;li&gt;SEAL - Professional Reasoning Benchmark - Finance: 55.01 (#1/29)&lt;/li&gt;&lt;li&gt;SEAL - Professional Reasoning Benchmark - Legal: 57.05 (#1/29)&lt;/li&gt;&lt;li&gt;SEAL - MCP Atlas: 88.1 (#1/24)&lt;/li&gt;&lt;li&gt;Vals AI TaxEval v2: 79.72 (#1/127)&lt;/li&gt;&lt;li&gt;Vals AI MedScribe: 88.89 (#1/70)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 20.0 (#1/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; — ELO 2718, #10&lt;ul&gt;&lt;li&gt;KernelBench Hub - Hard: 30.0 (#1/13)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 89.12 (#1/36)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - scBench-Long: 42.5 (#1/17)&lt;/li&gt;&lt;li&gt;Design Arena (UI Components): 1413.0 (#1/128)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 161.61 (#1/424)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 100.0 (#1/153)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 64.0 (#1/55)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 32.3 (#1/70)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 94.14 (#1/537)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 32.99 (#1/150)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.1 Pro&lt;/strong&gt; — ELO 2674, #11&lt;ul&gt;&lt;li&gt;BabyVision: 73.7 (#4/24)&lt;/li&gt;&lt;li&gt;Agents' Last Exam: 19.5 (#11/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5&lt;/strong&gt; — ELO 2608, #12&lt;ul&gt;&lt;li&gt;BabyVision: 83.6 (#1/24)&lt;/li&gt;&lt;li&gt;TaxCalcBench: 24.0 (#6/9)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; — ELO 2577, #13&lt;ul&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 1.02 (#14/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 7.91 (#20/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 5.2 (#22/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 1.43 (#29/32)&lt;/li&gt;&lt;li&gt;Agent Arena: 0.36 (#30/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 0.52 (#31/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Pro (Preview)&lt;/strong&gt; — ELO 2507, #15&lt;ul&gt;&lt;li&gt;TaxCalcBench: 2.0 (#9/9)&lt;/li&gt;&lt;li&gt;Agents' Last Exam: 15.8 (#12/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 5&lt;/strong&gt; — ELO 2441, #19&lt;ul&gt;&lt;li&gt;You're Absolutely Right!: 3.875 (#4/21)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Hard: 23.0 (#5/13)&lt;/li&gt;&lt;li&gt;GSO-Bench: 37.25 (#5/30)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Mega: 4.0 (#6/12)&lt;/li&gt;&lt;li&gt;EQ-Bench Longform Writing: 78.3 (#7/117)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - scBench-Long: 14.29 (#8/17)&lt;/li&gt;&lt;li&gt;TaxCalcBench: 6.0 (#8/9)&lt;/li&gt;&lt;li&gt;Kaggle Game Arena Poker (Heads Up): 2.21 (#9/20)&lt;/li&gt;&lt;li&gt;Bullshit Benchmark: 65.5 (#14/158)&lt;/li&gt;&lt;li&gt;SimpleBench: 60.6 (#19/86)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Pro&lt;/strong&gt; — ELO 2412, #22&lt;ul&gt;&lt;li&gt;Chatbot Arena (Image Edit): 1388.0 (#7/52)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Text-to-Image): 1245.0 (#8/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.5&lt;/strong&gt; — ELO 2403, #24&lt;ul&gt;&lt;li&gt;SWE-Marathon: 29.0 (#1/12)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 12.92 (#2/19)&lt;/li&gt;&lt;li&gt;RuneBench: 5682.0 (#3/30)&lt;/li&gt;&lt;li&gt;Lynchmark: 83.33 (#4/10)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Code): 1566.0 (#4/96)&lt;/li&gt;&lt;li&gt;Vals AI SWE-bench Verified: 86.6 (#4/69)&lt;/li&gt;&lt;li&gt;VoxelBench: 1775.0 (#5/45)&lt;/li&gt;&lt;li&gt;Senior SWE-Bench: 17.2 (#5/10)&lt;/li&gt;&lt;li&gt;Vals AI MedScribe: 86.88 (#5/70)&lt;/li&gt;&lt;li&gt;Vals AI GPQA: 92.93 (#5/121)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.2&lt;/strong&gt; — ELO 2398, #25&lt;ul&gt;&lt;li&gt;Design Arena (Website): 1346.0 (#1/152)&lt;/li&gt;&lt;li&gt;Design Arena (3D): 1371.0 (#1/125)&lt;/li&gt;&lt;li&gt;Design Arena (Game Dev): 1354.0 (#3/138)&lt;/li&gt;&lt;li&gt;Agent Security League - Functional Correctness: 82.5 (#4/17)&lt;/li&gt;&lt;li&gt;Design Arena (UI Components): 1335.0 (#5/128)&lt;/li&gt;&lt;li&gt;Design Arena (Data Viz): 1318.0 (#6/132)&lt;/li&gt;&lt;li&gt;Agent Security League - Security Correctness: 12.0 (#12/17)&lt;/li&gt;&lt;li&gt;Riemann-bench: 10.4 (#16/20)&lt;/li&gt;&lt;li&gt;SWE-rebench: 51.09 (#29/91)&lt;/li&gt;&lt;li&gt;LisanBench: 0.0161 (#89/150)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Terra&lt;/strong&gt; — ELO 2380, #27&lt;ul&gt;&lt;li&gt;Benchmarks.bio - scBench-Long: 25.4 (#2/17)&lt;/li&gt;&lt;li&gt;AA CritPt: 30.0 (#2/443)&lt;/li&gt;&lt;li&gt;Vals AI ProofBench: 71.0 (#3/49)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 67.61 (#3/21)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 85.96 (#4/36)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 99.72 (#4/153)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 30.0 (#4/70)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 31.75 (#4/150)&lt;/li&gt;&lt;li&gt;Gert Labs Rankings: 66.95 (#4/82)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 40.87 (#4/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5&lt;/strong&gt; — ELO 2356, #29&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 42.94 (#47/69)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash&lt;/strong&gt; — ELO 2324, #31&lt;ul&gt;&lt;li&gt;Chatbot Arena (Text-to-Image): 1261.0 (#5/74)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Image Edit): 1385.0 (#9/52)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Plus&lt;/strong&gt; — ELO 2317, #32&lt;ul&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.63 (#4/32)&lt;/li&gt;&lt;li&gt;Design Arena (Website): 1287.0 (#21/152)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 5.2 (#23/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 5.9 (#24/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 1.87 (#27/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 1.63 (#27/32)&lt;/li&gt;&lt;li&gt;Agent Arena: 0.43 (#29/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nex N2 Pro&lt;/strong&gt; — ELO 2290, #36&lt;ul&gt;&lt;li&gt;Wolfram LLM Benchmarking Project: 61.3 (#47/500)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Luna&lt;/strong&gt; — ELO 2265, #41&lt;ul&gt;&lt;li&gt;Vals AI IOI: 72.92 (#2/58)&lt;/li&gt;&lt;li&gt;Vals AI Terminal-Bench 2.1: 79.03 (#3/41)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - scBench-Long: 19.05 (#5/17)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 98.33 (#6/153)&lt;/li&gt;&lt;li&gt;Vals AI Vibe Code Bench: 77.06 (#6/72)&lt;/li&gt;&lt;li&gt;GDP.pdf: 22.7 (#6/17)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 82.11 (#7/36)&lt;/li&gt;&lt;li&gt;AA Long Context Reasoning: 74.0 (#7/465)&lt;/li&gt;&lt;li&gt;FrontierMath - Tier 4 (v2): 60.98 (#8/38)&lt;/li&gt;&lt;li&gt;AA GDPval: 1591.81 (#8/148)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro&lt;/strong&gt; — ELO 2263, #42&lt;ul&gt;&lt;li&gt;MCPMark: 15.75 (#29/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.7 Code&lt;/strong&gt; — ELO 2238, #46&lt;ul&gt;&lt;li&gt;Design Arena (SVG): 1237.0 (#24/99)&lt;/li&gt;&lt;li&gt;SimpleBench: 57.9 (#24/86)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro&lt;/strong&gt; — ELO 2230, #47&lt;ul&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.99 (#11/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 2.34 (#24/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 4.61 (#24/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 4.94 (#25/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 3.13 (#26/32)&lt;/li&gt;&lt;li&gt;Agent Arena: 0.83 (#28/32)&lt;/li&gt;&lt;li&gt;SWE-rebench: 42.7 (#45/91)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M3&lt;/strong&gt; — ELO 2228, #48&lt;ul&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.99 (#12/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 7.66 (#14/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 9.93 (#16/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 5.24 (#21/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 6.46 (#22/32)&lt;/li&gt;&lt;li&gt;Agent Arena: 3.08 (#23/32)&lt;/li&gt;&lt;li&gt;SimpleBench: 45.8 (#43/86)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 144.9 (#182/424)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5-Pro&lt;/strong&gt; — ELO 2204, #58&lt;ul&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.63 (#5/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 10.28 (#15/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 6.18 (#19/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 5.48 (#20/32)&lt;/li&gt;&lt;li&gt;Agent Arena: 3.71 (#22/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 2.77 (#30/32)&lt;/li&gt;&lt;li&gt;SWE-rebench: 42.36 (#46/91)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash&lt;/strong&gt; — ELO 2201, #59&lt;ul&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.6 (#3/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 9.37 (#8/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 10.65 (#14/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 7.33 (#16/32)&lt;/li&gt;&lt;li&gt;Agent Arena: 4.65 (#21/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 4.71 (#27/32)&lt;/li&gt;&lt;li&gt;SWE-rebench: 38.36 (#51/91)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.6&lt;/strong&gt; — ELO 2171, #63&lt;ul&gt;&lt;li&gt;BabyVision: 68.5 (#6/24)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 7.33 (#15/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 8.23 (#19/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 3.89 (#24/32)&lt;/li&gt;&lt;li&gt;Agent Arena: 1.61 (#25/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 2.34 (#25/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 1.24 (#30/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.1&lt;/strong&gt; — ELO 2136, #73&lt;ul&gt;&lt;li&gt;Agent Arena: 1.57 (#26/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 1.67 (#28/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 0.8 (#28/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 4.07 (#28/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 1.24 (#28/32)&lt;/li&gt;&lt;li&gt;SimpleBench: 55.1 (#28/86)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 0.05 (#32/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.3&lt;/strong&gt; — ELO 2127, #77&lt;ul&gt;&lt;li&gt;Agent Arena: 15.57 (#1/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 43.1 (#1/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 16.01 (#3/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 11.3 (#5/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.91 (#10/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 8.34 (#13/32)&lt;/li&gt;&lt;li&gt;RuneBench: 1609.0 (#20/30)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.5&lt;/strong&gt; — ELO 2091, #93&lt;ul&gt;&lt;li&gt;MCPMark: 32.09 (#9/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Max&lt;/strong&gt; — ELO 2090, #95&lt;ul&gt;&lt;li&gt;MCPMark: 17.72 (#25/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Pro&lt;/strong&gt; — ELO 2068, #98&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 756.0 (#101/292)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 591.0 (#112/237)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 27B&lt;/strong&gt; — ELO 2060, #102&lt;ul&gt;&lt;li&gt;SWE-rebench: 36.55 (#58/91)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4&lt;/strong&gt; — ELO 2058, #104&lt;ul&gt;&lt;li&gt;MCPMark: 31.69 (#10/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5V Turbo&lt;/strong&gt; — ELO 2050, #107&lt;ul&gt;&lt;li&gt;Chatbot Arena (Code): 1402.0 (#44/96)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Text): 1440.0 (#66/374)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4&lt;/strong&gt; — ELO 2036, #109&lt;ul&gt;&lt;li&gt;MCPMark: 28.15 (#15/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4 Fast&lt;/strong&gt; — ELO 2031, #111&lt;ul&gt;&lt;li&gt;MCPMark: 24.02 (#20/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.1&lt;/strong&gt; — ELO 2024, #113&lt;ul&gt;&lt;li&gt;MCPMark: 29.92 (#12/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Mini&lt;/strong&gt; — ELO 2016, #119&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 39.24 (#55/69)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O4 Mini&lt;/strong&gt; — ELO 2014, #121&lt;ul&gt;&lt;li&gt;MCPMark: 17.32 (#26/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5&lt;/strong&gt; — ELO 2007, #125&lt;ul&gt;&lt;li&gt;AA GDPval: 1145.01 (#50/148)&lt;/li&gt;&lt;li&gt;GDPval-AA: 1145.0 (#54/153)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 6.6 (#102/150)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mercury 2&lt;/strong&gt; — ELO 1980, #139&lt;ul&gt;&lt;li&gt;Design Arena (SVG): 1024.0 (#93/99)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2 0905&lt;/strong&gt; — ELO 1978, #142&lt;ul&gt;&lt;li&gt;MCPMark: 21.85 (#21/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Mini&lt;/strong&gt; — ELO 1972, #148&lt;ul&gt;&lt;li&gt;BenchLM: 65.0 (#33/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.7&lt;/strong&gt; — ELO 1967, #151&lt;ul&gt;&lt;li&gt;Agent Arena - Confirmed Success: 17.12 (#1/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 16.42 (#2/32)&lt;/li&gt;&lt;li&gt;Agent Arena: 10.18 (#5/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 14.49 (#5/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.89 (#9/32)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 3.74 (#29/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o ChatGPT&lt;/strong&gt; — ELO 1964, #155&lt;ul&gt;&lt;li&gt;LiveBench Table Join: 45.3 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 48.0 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 46.0 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 51.33 (#3/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 44.79 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 79.92 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 63.78 (#9/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 42.53 (#9/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 71.42 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 56.0 (#10/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash&lt;/strong&gt; — ELO 1955, #161&lt;ul&gt;&lt;li&gt;MCPMark: 9.06 (#31/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hy3&lt;/strong&gt; — ELO 1946, #168&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1540.0 (#15/292)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 1021.0 (#38/237)&lt;/li&gt;&lt;li&gt;Gert Labs Rankings: 41.68 (#56/82)&lt;/li&gt;&lt;li&gt;Design Arena (Game Dev): 1202.0 (#61/138)&lt;/li&gt;&lt;li&gt;SvelteBench: 88.9 (#66/145)&lt;/li&gt;&lt;li&gt;Design Arena (Website): 1198.0 (#74/152)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.5&lt;/strong&gt; — ELO 1932, #173&lt;ul&gt;&lt;li&gt;MCPMark: 15.55 (#30/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Sonnet (20240620)&lt;/strong&gt; — ELO 1925, #177&lt;ul&gt;&lt;li&gt;LiveBench AMPS Hard: 49.0 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 55.14 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 48.0 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 67.46 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 68.0 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 66.0 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 40.22 (#3/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 49.67 (#4/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 44.79 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 72.22 (#8/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.1 Terminus&lt;/strong&gt; — ELO 1924, #181&lt;ul&gt;&lt;li&gt;MCPMark: 16.54 (#28/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1&lt;/strong&gt; — ELO 1923, #183&lt;ul&gt;&lt;li&gt;MCPMark: 8.07 (#33/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Coder Plus&lt;/strong&gt; — ELO 1904, #196&lt;ul&gt;&lt;li&gt;MCPMark: 24.8 (#19/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;qwen3.5-flash&lt;/strong&gt; — ELO 1879, #217&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 437.0 (#182/237)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o (2024-05-13)&lt;/strong&gt; — ELO 1871, #219&lt;ul&gt;&lt;li&gt;LiveBench Connections: 53.0 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 66.0 (#3/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 45.0 (#4/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 65.06 (#4/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 74.62 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 42.81 (#8/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 70.8 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 40.0 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 39.58 (#11/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 29.22 (#12/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Pro (Preview 0801)&lt;/strong&gt; — ELO 1869, #222&lt;ul&gt;&lt;li&gt;LiveBench Summarize: 83.13 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 68.0 (#3/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 78.63 (#4/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 76.5 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 62.0 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 43.0 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 41.87 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 61.88 (#11/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 77.08 (#11/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 37.5 (#12/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Pro (Preview 0827)&lt;/strong&gt; — ELO 1866, #227&lt;ul&gt;&lt;li&gt;LiveBench Math Comp: 54.17 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 68.66 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 46.0 (#3/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 77.8 (#3/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 68.0 (#4/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 77.58 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 62.0 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 43.44 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 73.4 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 42.5 (#8/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 Turbo&lt;/strong&gt; — ELO 1858, #231&lt;ul&gt;&lt;li&gt;LiveBench Connections: 44.17 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 44.79 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 74.23 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 79.92 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 42.0 (#8/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 35.96 (#8/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 60.19 (#13/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 64.0 (#13/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 52.0 (#13/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 39.62 (#14/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen3 Coder Next&lt;/strong&gt; — ELO 1857, #233&lt;ul&gt;&lt;li&gt;Tau3 Banking: 5.15 (#119/150)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 35B A3B&lt;/strong&gt; — ELO 1855, #236&lt;ul&gt;&lt;li&gt;SWE-rebench: 33.82 (#65/91)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o (2024-08-06)&lt;/strong&gt; — ELO 1839, #245&lt;ul&gt;&lt;li&gt;LiveBench Connections: 58.0 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 65.96 (#3/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 47.92 (#4/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 38.68 (#4/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 45.11 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 80.08 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 75.78 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 43.0 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 60.0 (#8/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 42.0 (#8/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 Preview (0125)&lt;/strong&gt; — ELO 1833, #247&lt;ul&gt;&lt;li&gt;LiveBench Table Reformat: 70.0 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 44.0 (#4/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 43.49 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 43.17 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 36.18 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 37.0 (#14/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 36.46 (#18/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 65.68 (#19/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 44.0 (#21/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 54.79 (#22/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Flash (Preview 0827)&lt;/strong&gt; — ELO 1832, #249&lt;ul&gt;&lt;li&gt;LiveBench Simplify: 84.75 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 81.33 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 73.58 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 72.77 (#9/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 63.4 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 64.0 (#11/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 36.46 (#16/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 34.63 (#18/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 30.5 (#19/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 21.6 (#20/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok Code Fast 1&lt;/strong&gt; — ELO 1780, #279&lt;ul&gt;&lt;li&gt;MCPMark: 20.47 (#23/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3 Chat&lt;/strong&gt; — ELO 1774, #288&lt;ul&gt;&lt;li&gt;MCPMark: 16.73 (#27/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 70B Instruct&lt;/strong&gt; — ELO 1764, #297&lt;ul&gt;&lt;li&gt;LiveBench Paraphrase: 82.25 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 83.85 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 68.0 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 74.8 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 41.67 (#9/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 30.88 (#9/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 41.67 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 60.06 (#14/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 75.42 (#14/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 35.0 (#15/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 Mini&lt;/strong&gt; — ELO 1756, #303&lt;ul&gt;&lt;li&gt;MCPMark: 3.94 (#38/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 405B Instruct&lt;/strong&gt; — ELO 1724, #336&lt;ul&gt;&lt;li&gt;LiveBench Paraphrase: 81.13 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 78.33 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 47.38 (#3/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 78.93 (#3/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 44.17 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 36.52 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 64.15 (#8/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 58.0 (#9/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 38.0 (#12/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 37.5 (#13/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Opus (20240229)&lt;/strong&gt; — ELO 1713, #345&lt;ul&gt;&lt;li&gt;LiveBench Typos: 68.0 (#1/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 50.16 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 40.96 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 41.67 (#9/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 64.0 (#9/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 38.0 (#11/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 72.55 (#11/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 70.48 (#11/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 37.0 (#12/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 69.38 (#13/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 2 (Jul)&lt;/strong&gt; — ELO 1702, #357&lt;ul&gt;&lt;li&gt;LiveBench Olympiad: 64.41 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 78.5 (#8/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 73.13 (#9/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 40.05 (#12/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 50.0 (#14/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 68.15 (#15/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 64.0 (#17/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 21.82 (#19/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 29.33 (#20/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 67.6 (#20/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 (0613)&lt;/strong&gt; — ELO 1698, #363&lt;ul&gt;&lt;li&gt;LiveBench Plot Unscrambling: 45.54 (#4/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 64.0 (#4/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 42.0 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 73.33 (#8/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 39.17 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 76.08 (#12/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 70.97 (#14/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 58.7 (#18/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 20.08 (#21/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 66.77 (#23/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek Coder V2&lt;/strong&gt; — ELO 1696, #367&lt;ul&gt;&lt;li&gt;LiveBench Math Comp: 50.0 (#3/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 43.0 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 64.61 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 42.0 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 30.76 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 75.33 (#15/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 64.7 (#21/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 42.0 (#22/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 31.3 (#23/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 25.83 (#25/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2 72B Instruct&lt;/strong&gt; — ELO 1689, #376&lt;ul&gt;&lt;li&gt;LiveBench Story Generation: 80.17 (#4/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 40.0 (#13/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 37.5 (#14/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 34.0 (#15/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 59.81 (#16/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 68.73 (#16/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 33.0 (#20/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 33.64 (#21/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 62.02 (#30/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 62.17 (#31/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 Max&lt;/strong&gt; — ELO 1652, #417&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 667.0 (#138/292)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 414.0 (#194/237)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 12B (IT)&lt;/strong&gt; — ELO 1639, #425&lt;ul&gt;&lt;li&gt;GDPval-AA: 144.0 (#139/153)&lt;/li&gt;&lt;li&gt;AA GDPval: -143.64 (#146/148)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3.5-MoE-instruct&lt;/strong&gt; — ELO 1622, #444&lt;ul&gt;&lt;li&gt;LiveBench AMPS Hard: 32.0 (#21/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 66.3 (#24/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 58.0 (#24/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 26.04 (#26/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 63.28 (#28/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 34.0 (#31/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 26.0 (#35/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 41.87 (#36/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 51.6 (#44/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 11.0 (#45/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 2 27B (IT)&lt;/strong&gt; — ELO 1598, #468&lt;ul&gt;&lt;li&gt;LiveBench Zebra Puzzle: 42.0 (#6/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 71.13 (#9/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 64.0 (#12/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 33.0 (#19/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 64.42 (#22/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 53.83 (#24/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 42.0 (#24/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 25.17 (#26/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 30.03 (#26/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 64.52 (#26/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V2.5&lt;/strong&gt; — ELO 1593, #474&lt;ul&gt;&lt;li&gt;LiveBench Math Comp: 53.12 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 64.29 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 40.0 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 77.17 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 64.0 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 68.72 (#17/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 35.38 (#17/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 24.34 (#17/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 65.12 (#20/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 28.17 (#22/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3 70B Instruct&lt;/strong&gt; — ELO 1580, #490&lt;ul&gt;&lt;li&gt;LiveBench Table Join: 25.24 (#16/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 31.17 (#17/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 67.13 (#18/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 54.11 (#23/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 31.15 (#24/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 69.75 (#25/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 40.0 (#26/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 52.0 (#29/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 59.25 (#33/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 22.0 (#35/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Flash (0514)&lt;/strong&gt; — ELO 1572, #509&lt;ul&gt;&lt;li&gt;LiveBench Olympiad: 61.67 (#12/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 38.0 (#16/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 46.0 (#17/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 24.08 (#18/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 66.77 (#20/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 30.0 (#25/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 54.0 (#25/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 66.1 (#27/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 29.41 (#27/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 25.0 (#28/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o Mini (2024-07-18)&lt;/strong&gt; — ELO 1568, #515&lt;ul&gt;&lt;li&gt;LiveBench AMPS Hard: 41.0 (#9/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 36.5 (#14/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 46.0 (#18/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 35.42 (#19/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 60.0 (#21/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 36.0 (#21/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 67.0 (#22/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 65.53 (#23/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 71.0 (#23/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 48.32 (#26/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Pro (0514)&lt;/strong&gt; — ELO 1560, #527&lt;ul&gt;&lt;li&gt;LiveBench Table Join: 38.42 (#5/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 66.0 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 56.0 (#11/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 39.92 (#13/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 71.05 (#13/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 69.27 (#14/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 34.0 (#17/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 36.46 (#17/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 56.8 (#20/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 63.8 (#24/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large&lt;/strong&gt; — ELO 1540, #564&lt;ul&gt;&lt;li&gt;LiveBench Zebra Puzzle: 40.0 (#11/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 69.23 (#13/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 64.0 (#16/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 67.27 (#17/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 33.9 (#20/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 72.92 (#20/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 28.33 (#21/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 28.12 (#22/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 15.66 (#25/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 46.49 (#28/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 1.5 110B Chat&lt;/strong&gt; — ELO 1511, #607&lt;ul&gt;&lt;li&gt;LiveBench AMPS Hard: 23.0 (#33/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 20.33 (#34/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 10.36 (#35/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 39.16 (#38/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 55.52 (#38/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 59.52 (#41/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 59.25 (#42/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 28.0 (#44/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 15.34 (#46/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 16.67 (#47/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mixtral 8x22B Instruct (v0.1)&lt;/strong&gt; — ELO 1507, #614&lt;ul&gt;&lt;li&gt;LiveBench Simplify: 66.87 (#19/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 19.0 (#23/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 63.62 (#26/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 25.17 (#27/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 28.27 (#28/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 27.0 (#29/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 68.67 (#29/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 34.0 (#29/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 43.41 (#34/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 26.0 (#34/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3-medium-4k-instruct&lt;/strong&gt; — ELO 1480, #664&lt;ul&gt;&lt;li&gt;LiveBench Math Comp: 27.08 (#24/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 29.0 (#26/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 30.0 (#39/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 14.0 (#40/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 37.99 (#40/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 55.78 (#42/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 36.0 (#43/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 15.73 (#44/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 56.47 (#47/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 4.88 (#47/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ling-2.6-flash&lt;/strong&gt; — ELO 1475, #680&lt;ul&gt;&lt;li&gt;Tau3 Banking: 2.89 (#137/150)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Opus&lt;/strong&gt; — ELO 1468, #691&lt;ul&gt;&lt;li&gt;BabyVision: 81.2 (#2/24)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Command-R+ (08-2024)&lt;/strong&gt; — ELO 1468, #692&lt;ul&gt;&lt;li&gt;LiveBench Zebra Puzzle: 38.0 (#15/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 65.87 (#18/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 44.0 (#20/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 52.0 (#27/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 23.67 (#28/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 62.85 (#29/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 23.96 (#30/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 64.43 (#30/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 25.19 (#31/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 11.76 (#31/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3-small-8k-instruct&lt;/strong&gt; — ELO 1455, #715&lt;ul&gt;&lt;li&gt;LiveBench Zebra Puzzle: 40.0 (#12/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 19.5 (#35/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 64.08 (#36/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 42.0 (#38/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 18.75 (#41/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 53.22 (#41/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 15.89 (#42/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 36.44 (#43/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 57.93 (#45/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 16.0 (#47/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3-medium-128k-instruct&lt;/strong&gt; — ELO 1452, #717&lt;ul&gt;&lt;li&gt;LiveBench Math Comp: 25.0 (#29/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 44.0 (#34/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 62.07 (#36/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 63.75 (#37/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 21.0 (#39/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 51.7 (#45/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 9.5 (#48/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 14.77 (#49/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 14.0 (#49/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 4.36 (#50/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;c4ai-command-r-08-2024&lt;/strong&gt; — ELO 1444, #735&lt;ul&gt;&lt;li&gt;LiveBench Paraphrase: 69.05 (#15/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 34.0 (#24/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 69.58 (#26/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 47.29 (#27/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 63.77 (#27/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 60.42 (#31/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 18.16 (#35/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 42.0 (#36/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 18.75 (#38/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 20.0 (#39/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Sonnet (20240229)&lt;/strong&gt; — ELO 1440, #746&lt;ul&gt;&lt;li&gt;LiveBench Typos: 54.0 (#12/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 67.23 (#17/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 34.08 (#19/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 62.0 (#19/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 36.0 (#19/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 26.17 (#24/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 15.68 (#24/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 50.24 (#25/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 64.55 (#25/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 65.82 (#28/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 Nano&lt;/strong&gt; — ELO 1439, #748&lt;ul&gt;&lt;li&gt;MCPMark: 0.0 (#39/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-3.5 Turbo (0125)&lt;/strong&gt; — ELO 1433, #756&lt;ul&gt;&lt;li&gt;LiveBench Table Join: 19.64 (#22/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 42.0 (#25/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 54.0 (#26/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 34.0 (#27/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 65.77 (#29/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 44.26 (#31/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 67.08 (#31/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 23.0 (#32/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 17.32 (#37/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 57.03 (#39/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-3.5 Turbo&lt;/strong&gt; — ELO 1426, #772&lt;ul&gt;&lt;li&gt;SimpleBench: 8.0 (#86/86)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3 8B Instruct&lt;/strong&gt; — ELO 1423, #779&lt;ul&gt;&lt;li&gt;LiveBench Connections: 20.33 (#33/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 61.88 (#37/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 30.0 (#37/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 54.27 (#39/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 56.17 (#41/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 20.0 (#41/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 15.82 (#43/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 36.41 (#44/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 34.0 (#46/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 14.58 (#50/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 1.5 72B Chat&lt;/strong&gt; — ELO 1421, #784&lt;ul&gt;&lt;li&gt;LiveBench Story Generation: 69.08 (#28/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 43.77 (#32/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 10.94 (#32/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 34.0 (#32/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 17.94 (#36/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 56.83 (#36/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 56.23 (#40/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 19.0 (#42/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 36.0 (#44/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 17.71 (#45/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hermes 3 - Llama-3.1 70B&lt;/strong&gt; — ELO 1420, #787&lt;ul&gt;&lt;li&gt;LiveBench Typos: 62.0 (#7/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 66.0 (#8/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 26.34 (#15/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 32.0 (#16/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 37.32 (#16/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 20.83 (#34/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 43.12 (#35/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 32.0 (#35/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 58.65 (#37/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 21.0 (#38/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2 (0711)&lt;/strong&gt; — ELO 1416, #796&lt;ul&gt;&lt;li&gt;MCPMark: 19.09 (#24/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 2 9B (IT)&lt;/strong&gt; — ELO 1410, #815&lt;ul&gt;&lt;li&gt;LiveBench Paraphrase: 68.05 (#19/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 28.0 (#27/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 38.0 (#27/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 23.0 (#29/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 50.0 (#30/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 61.77 (#32/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 21.93 (#34/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 59.05 (#35/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 5.18 (#46/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 57.33 (#49/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 8B Instruct&lt;/strong&gt; — ELO 1402, #835&lt;ul&gt;&lt;li&gt;LiveBench Paraphrase: 64.03 (#31/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 50.0 (#31/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 30.0 (#31/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 57.52 (#38/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 16.98 (#39/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 54.0 (#40/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 20.0 (#41/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 13.17 (#42/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 17.71 (#44/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 35.4 (#45/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3.5-mini-instruct&lt;/strong&gt; — ELO 1402, #836&lt;ul&gt;&lt;li&gt;LiveBench Zebra Puzzle: 34.0 (#30/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 65.5 (#32/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 59.93 (#32/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 21.0 (#40/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 53.2 (#44/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 5.28 (#45/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 16.67 (#46/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 34.0 (#47/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 54.57 (#50/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 5.17 (#53/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Haiku (20240307)&lt;/strong&gt; — ELO 1400, #845&lt;ul&gt;&lt;li&gt;LiveBench Summarize: 69.58 (#12/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 48.0 (#15/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 62.0 (#18/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 65.1 (#24/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 12.62 (#28/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 45.38 (#30/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 23.72 (#32/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 63.52 (#33/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 32.0 (#33/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 19.79 (#36/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mixtral 8x7B Instruct (v0.1)&lt;/strong&gt; — ELO 1395, #857&lt;ul&gt;&lt;li&gt;LiveBench Connections: 15.0 (#39/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 16.28 (#41/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 16.0 (#46/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 15.62 (#48/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 30.0 (#50/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 30.5 (#55/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 10.0 (#57/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 42.75 (#58/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 2.38 (#58/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 51.08 (#59/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3-small-128k-instruct&lt;/strong&gt; — ELO 1392, #866&lt;ul&gt;&lt;li&gt;LiveBench AMPS Hard: 28.0 (#28/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 64.67 (#35/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 19.79 (#37/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 39.12 (#39/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 40.0 (#39/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 20.0 (#42/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 28.0 (#43/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 12.83 (#44/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 51.08 (#46/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 3.78 (#52/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 Turbo&lt;/strong&gt; — ELO 1389, #881&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 438.0 (#178/237)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 574.0 (#201/292)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek Coder V2 Lite Instruct&lt;/strong&gt; — ELO 1383, #901&lt;ul&gt;&lt;li&gt;LiveBench AMPS Hard: 33.0 (#18/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 33.33 (#20/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 52.0 (#28/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 9.0 (#37/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 20.0 (#40/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 36.98 (#41/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 58.25 (#45/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 20.0 (#55/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 52.85 (#57/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 44.2 (#57/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3 Mini 4K Instruct&lt;/strong&gt; — ELO 1381, #908&lt;ul&gt;&lt;li&gt;LiveBench Table Reformat: 38.0 (#42/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 28.0 (#42/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 58.67 (#43/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 50.67 (#48/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 4.64 (#48/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 14.0 (#49/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 15.62 (#49/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 32.89 (#50/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 53.98 (#53/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 13.18 (#55/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small (2402)&lt;/strong&gt; — ELO 1375, #930&lt;ul&gt;&lt;li&gt;LiveBench Math Comp: 27.08 (#23/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 70.67 (#24/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 63.75 (#25/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 26.5 (#29/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 21.67 (#31/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 44.0 (#33/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 62.07 (#35/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 59.15 (#36/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 41.35 (#37/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 7.64 (#41/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3 Mini 128K Instruct&lt;/strong&gt; — ELO 1367, #950&lt;ul&gt;&lt;li&gt;LiveBench Table Reformat: 44.0 (#35/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 30.0 (#40/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 6.06 (#43/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 49.35 (#47/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 14.0 (#48/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 54.15 (#52/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 48.7 (#52/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 53.42 (#55/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 29.9 (#57/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 10.0 (#58/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2 7B Instruct&lt;/strong&gt; — ELO 1355, #978&lt;ul&gt;&lt;li&gt;LiveBench AMPS Hard: 25.0 (#31/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 23.96 (#32/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 36.0 (#45/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 10.0 (#46/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 14.62 (#50/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 31.65 (#52/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 24.0 (#52/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 45.02 (#53/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 2.24 (#59/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 40.0 (#63/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Command-R+&lt;/strong&gt; — ELO 1344, #1008&lt;ul&gt;&lt;li&gt;LiveBench Story Generation: 80.83 (#2/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 46.0 (#3/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 72.63 (#10/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 70.22 (#11/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 62.35 (#28/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 45.81 (#29/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 22.33 (#30/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 25.43 (#30/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 11.8 (#30/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 24.0 (#36/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nanbeige4.1-3B&lt;/strong&gt; — ELO 1341, #1012&lt;ul&gt;&lt;li&gt;GDPval-AA: 141.0 (#141/153)&lt;/li&gt;&lt;li&gt;AA GDPval: -141.11 (#145/148)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 0.0 (#149/150)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;zephyr-7B-alpha&lt;/strong&gt; — ELO 1337, #1020&lt;ul&gt;&lt;li&gt;LiveBench Paraphrase: 57.98 (#44/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 58.17 (#46/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 47.32 (#50/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 4.2 (#51/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 47.7 (#54/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 4.0 (#56/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 11.59 (#59/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 20.0 (#61/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 19.62 (#62/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 12.0 (#62/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenHermes-2.5-Mistral-7B&lt;/strong&gt; — ELO 1327, #1040&lt;ul&gt;&lt;li&gt;LiveBench Story Generation: 64.92 (#33/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 36.8 (#42/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 6.76 (#42/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 18.0 (#45/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 15.11 (#47/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 26.0 (#47/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 11.0 (#52/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 45.68 (#52/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 28.0 (#52/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 13.54 (#54/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Starling-LM-7B-beta&lt;/strong&gt; — ELO 1319, #1057&lt;ul&gt;&lt;li&gt;LiveBench Connections: 4.5 (#54/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 13.29 (#54/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 22.0 (#54/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 11.46 (#56/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 9.0 (#57/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 24.13 (#61/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 47.48 (#64/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 31.08 (#66/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 31.8 (#67/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 42.92 (#67/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Command R&lt;/strong&gt; — ELO 1314, #1065&lt;ul&gt;&lt;li&gt;LiveBench Zebra Puzzle: 38.0 (#14/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 9.08 (#36/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 22.0 (#38/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 63.5 (#39/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 59.85 (#40/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 38.0 (#40/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 17.71 (#43/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 53.83 (#43/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 51.47 (#45/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 7.67 (#49/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-4 Mini Instruct&lt;/strong&gt; — ELO 1291, #1099&lt;ul&gt;&lt;li&gt;Tau3 Banking: 1.03 (#144/150)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 1.1 7B (IT)&lt;/strong&gt; — ELO 1249, #1181&lt;ul&gt;&lt;li&gt;LiveBench Connections: 7.17 (#50/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 12.0 (#51/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 31.48 (#53/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 10.0 (#54/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 12.78 (#57/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 2.52 (#57/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 20.0 (#57/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 51.35 (#59/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 40.72 (#59/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 41.78 (#60/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral 7B Instruct (v0.3)&lt;/strong&gt; — ELO 1230, #1206&lt;ul&gt;&lt;li&gt;LiveBench Plot Unscrambling: 15.39 (#45/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 33.48 (#48/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 56.02 (#48/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 14.0 (#48/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 50.03 (#49/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 47.75 (#49/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 6.17 (#52/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 55.67 (#52/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 18.0 (#58/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 5.0 (#61/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral 7B Instruct (v0.2)&lt;/strong&gt; — ELO 1223, #1216&lt;ul&gt;&lt;li&gt;LiveBench Summarize: 51.75 (#43/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 58.42 (#44/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 34.87 (#46/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 6.17 (#51/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 54.52 (#51/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 13.0 (#56/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 41.92 (#59/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 7.0 (#60/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 9.38 (#60/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 8.0 (#60/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2 1.5B Instruct&lt;/strong&gt; — ELO 1221, #1217&lt;ul&gt;&lt;li&gt;LiveBench Table Join: 2.02 (#60/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 5.0 (#62/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 8.33 (#62/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 8.0 (#64/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 16.0 (#65/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 16.49 (#67/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 40.42 (#68/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 26.2 (#70/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 0.0 (#71/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 9.14 (#71/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 1.5 4B Chat&lt;/strong&gt; — ELO 1185, #1245&lt;ul&gt;&lt;li&gt;LiveBench Zebra Puzzle: 26.0 (#48/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 3.38 (#54/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 10.42 (#58/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 8.0 (#62/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 4.0 (#63/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 6.0 (#66/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 15.15 (#68/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 31.62 (#68/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 0.0 (#69/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 22.65 (#69/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 1.5 7B Chat&lt;/strong&gt; — ELO 1183, #1248&lt;ul&gt;&lt;li&gt;LiveBench Zebra Puzzle: 22.0 (#53/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 10.0 (#55/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 2.7 (#56/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 3.5 (#57/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 41.77 (#57/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 28.59 (#59/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 50.65 (#61/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 11.04 (#62/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 46.67 (#64/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 7.29 (#65/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;zephyr-7B-beta&lt;/strong&gt; — ELO 1183, #1249&lt;ul&gt;&lt;li&gt;LiveBench Simplify: 49.62 (#51/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 11.46 (#57/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 51.77 (#58/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 52.17 (#58/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 14.0 (#59/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 39.72 (#60/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 10.85 (#64/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 1.24 (#64/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 4.0 (#65/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 18.23 (#65/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 2 7B Chat&lt;/strong&gt; — ELO 1131, #1306&lt;ul&gt;&lt;li&gt;LiveBench Paraphrase: 55.12 (#49/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 10.0 (#56/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 40.27 (#61/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 38.07 (#62/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 46.08 (#65/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 0.0 (#66/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 10.58 (#66/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 0.0 (#67/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 14.35 (#69/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 10.0 (#70/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Yi 6B (Chat)&lt;/strong&gt; — ELO 1130, #1308&lt;ul&gt;&lt;li&gt;LiveBench Table Reformat: 12.0 (#61/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 19.42 (#63/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 1.14 (#65/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 10.07 (#67/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 2.0 (#68/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 25.7 (#68/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 4.0 (#68/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 39.5 (#69/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 12.0 (#69/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 4.17 (#71/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;vicuna-7B-v1.5&lt;/strong&gt; — ELO 1074, #1338&lt;ul&gt;&lt;li&gt;LiveBench Typos: 14.0 (#50/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 50.67 (#60/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 40.22 (#62/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 1.0 (#63/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 8.33 (#63/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 10.98 (#63/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 32.77 (#64/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 43.37 (#67/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 14.0 (#67/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 1.0 (#69/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;vicuna-7B-v1.5-16k&lt;/strong&gt; — ELO 1036, #1363&lt;ul&gt;&lt;li&gt;LiveBench Story Generation: 53.5 (#54/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 12.0 (#55/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 20.0 (#60/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 49.82 (#62/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 1.8 (#62/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 1.0 (#64/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 18.84 (#64/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 10.75 (#65/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 32.07 (#65/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 8.0 (#65/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 1.5 1.8B Chat&lt;/strong&gt; — ELO 965, #1394&lt;ul&gt;&lt;li&gt;LiveBench Connections: 0.0 (#68/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 9.47 (#69/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 4.0 (#69/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 4.17 (#70/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 21.57 (#70/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 0.0 (#70/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 23.4 (#71/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 0.0 (#71/73)&lt;/li&gt;&lt;li&gt;LiveBench Zebra Puzzle: 10.0 (#71/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 23.48 (#72/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2 0.5B Instruct&lt;/strong&gt; — ELO 958, #1399&lt;ul&gt;&lt;li&gt;LiveBench Math Comp: 9.38 (#61/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 3.0 (#67/73)&lt;/li&gt;&lt;li&gt;LiveBench Simplify: 23.37 (#68/73)&lt;/li&gt;&lt;li&gt;LiveBench Paraphrase: 30.9 (#69/73)&lt;/li&gt;&lt;li&gt;LiveBench Connections: 0.0 (#70/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 28.08 (#71/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 24.17 (#71/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 0.0 (#71/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 9.66 (#72/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 0.0 (#72/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 1.5 0.5B Chat&lt;/strong&gt; — ELO 814, #1448&lt;ul&gt;&lt;li&gt;LiveBench Connections: 0.0 (#67/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Join: 0.0 (#69/73)&lt;/li&gt;&lt;li&gt;LiveBench Summarize: 24.95 (#70/73)&lt;/li&gt;&lt;li&gt;LiveBench Typos: 0.0 (#70/73)&lt;/li&gt;&lt;li&gt;LiveBench Olympiad: 10.16 (#71/73)&lt;/li&gt;&lt;li&gt;LiveBench AMPS Hard: 0.0 (#72/73)&lt;/li&gt;&lt;li&gt;LiveBench Math Comp: 3.12 (#72/73)&lt;/li&gt;&lt;li&gt;LiveBench Plot Unscrambling: 8.63 (#72/73)&lt;/li&gt;&lt;li&gt;LiveBench Story Generation: 25.83 (#72/73)&lt;/li&gt;&lt;li&gt;LiveBench Table Reformat: 0.0 (#72/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (121)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on KernelBench Hub - Hard: 24.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on KernelBench Hub - Mega: 18.7 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Lean AI Formalization Leaderboard: 4.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on TaxCalcBench: 26.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on TrackingAI IQ Test (Mensa Norway): 60.0 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on TrackingAI IQ Test (Vision): 78.57 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; on TaxCalcBench: 16.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA GDPval: 1747.82 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA GPQA Diamond: 94.14 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Humanity's Last Exam: 47.17 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA IFBench: 72.65 (#47)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Long Context Reasoning: 73.67 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA MMMU-Pro: 83.41 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience: 21.7 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Business: 50.6 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Health: 50.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 58.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Law: 53.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 54.1 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 84.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - C: 88.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Dart: 76.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Go: 82.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Java: 72.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - JavaScript: 89.09 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Julia: 56.0 (#34)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Kotlin: 88.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Python: 88.5 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - R: 66.0 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Rust: 84.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Swift: 84.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA SciCode: 56.13 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA TAU-2 Bench: 85.09 (#99)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA-Omniscience Accuracy: 58.53 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI Chess Leaderboard (Continuation): 1213.0 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI Chess Leaderboard (Reasoning): 1611.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ARC-AGI-1: 96.5 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ARC-AGI-2: 92.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Artificial Analysis Intelligence Index: 58.89 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on BridgeBench Debugging: 80.1 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on BridgeBench Hallucination: 76.8 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on BridgeBench Refactoring: 64.7 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on BridgeBench Security: 70.6 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on BridgeBench UI: 77.6 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Bullshit Benchmark: 27.3 (#59)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Chess Puzzles (Epoch AI): 64.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Chess Puzzles (Epoch AI): 64.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CursorBench 3.1: 67.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (3D): 1370.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (Data Viz): 1344.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (Game Dev): 1378.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (UI Components): 1413.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (Website): 1344.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Cursorbench: 67.2 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Scicode: 56.13 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on FrontierMath - Tier 4 (v2): 82.93 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on FrontierMath - Tier 4 (v2): 82.93 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on GDPval-AA: 1748.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Gert Labs Rankings: 73.04 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on KernelBench Hub - Mega: 1.1 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LisanBench: 0.0721 (#45)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Mercor APEX: 40.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Mercor APEX: 40.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OTIS Mock AIME 2024-25: 100.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on PM-LLM-Benchmark: 36.3 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on PinchBench: 87.0 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Ramp SWE-Bench: 82.28 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Senior SWE-Bench: 24.4 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SimpleBench: 64.8 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SimpleQA Verified: 71.6 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SvelteBench: 94.4 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on TaxCalcBench: 26.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI (Vals Index): 72.63 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI Code Migration: 52.92 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI CorpFin v2: 64.38 (#31)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI Finance Agent v2: 53.76 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI GPQA: 95.2 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI Harvey Legal Agent Bench: 2.5 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI LegalBench: 86.97 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI LiveCodeBench: 82.6 (#38)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI MMLU-Pro: 89.1 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI MMMU: 88.84 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI MedCode: 43.97 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI MedScribe: 85.23 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI MortgageTax: 67.29 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI Multimodal Index: 72.19 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI ProofBench: 77.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI Public Benefits Bench: 66.51 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI SAGE: 52.56 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI TaxEval v2: 74.78 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals AI Vibe Code Bench: 80.5 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vending-Bench 2: 9619.37 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on YC-Bench: 685.9 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on You're Absolutely Right!: 2.875 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Chatbot Arena (Code): 1540.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Chatbot Arena (Text): 1490.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on SEAL - Fortress: 12.4 (#54)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on SEAL - MultiChallenge: 75.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on SvelteBench: 92.2 (#36)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI (Vals Index): 68.41 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Code Migration: 31.11 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI CorpFin v2: 71.29 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Excel Modeling: 56.36 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Finance Agent v2: 57.21 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI GPQA: 91.16 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Legal Research Bench: 37.98 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI LegalBench: 84.98 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI LiveCodeBench: 85.91 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI MMLU-Pro: 88.73 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI MMMU: 86.59 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI MortgageTax: 66.14 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Multimodal Index: 66.74 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI ProgramBench: 16.16 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI ProofBench: 39.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Public Benefits Bench: 61.3 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI SAGE: 45.58 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI SWE-bench Verified: 82.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 69.29 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Vibe Code Bench: 72.16 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.1 Pro&lt;/strong&gt; on Agents' Last Exam: 19.5 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.1 Pro&lt;/strong&gt; on BabyVision: 73.7 (#4)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (66)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;PredictionArena (Kalshi)&lt;/strong&gt;: Claude Opus 4.6 (221482.25) beat GLM-5 by 203630.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RuneBench&lt;/strong&gt;: GPT-5.6 Sol (7400.0) beat GPT-5.5 by 1030.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VoxelBench&lt;/strong&gt;: GPT-5.6 Sol (2306.0) beat Claude Fable 5 (Max) by 83.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WDCD R3 Pressure Integrity&lt;/strong&gt;: Gemini 3.1 Pro (Preview) (138.0) beat Grok 4 by 25.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BabyVision&lt;/strong&gt;: GPT-5.5 (83.6) beat Seed 2.0 Pro (High) by 23.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - VisualToolBench (VTB)&lt;/strong&gt;: Muse Spark 1.1 (44.77) beat GPT-5.4 by 15.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI IOI&lt;/strong&gt;: GPT-5.6 Sol (86.67) beat Claude Fable 5 by 14.42&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - scBench-Long&lt;/strong&gt;: GPT-5.6 Sol (42.5) beat Claude Opus 4.8 by 13.93&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Simplify&lt;/strong&gt;: Gemini 1.5 Flash (Preview 0827) (84.75) beat Gemini 3.1 Pro (Preview) (High) by 13.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TabArena All Tasks&lt;/strong&gt;: TabFM (default) (89.1) beat TabPFN-3 (default) by 11.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Opus Magnum Bench&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (70.86) beat Claude Fable 5 (High) by 10.71&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Harvey Legal Agent Bench&lt;/strong&gt;: Muse Spark 1.1 (20.0) beat Claude Fable 5 by 8.75&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE Atlas - Codebase QnA&lt;/strong&gt;: Claude Opus 4.8 (Claude Code) xhigh (57.26) beat Claude Opus 4.8 (Claude Code) by 8.47&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI CyberBench&lt;/strong&gt;: GPT-5.6 Sol (88.14) beat GPT-5.5 by 7.63&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WolfBench&lt;/strong&gt;: GPT-5.6 Sol (85.0) beat GPT-5.5 by 6.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Terminal-Bench 2.1&lt;/strong&gt;: GPT-5.6 Sol (85.77) beat Claude Fable 5 by 5.25&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Senior SWE-Bench&lt;/strong&gt;: Claude Fable 5 (29.1) beat Claude Opus 4.8 by 5.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - Professional Reasoning Benchmark - Legal&lt;/strong&gt;: Muse Spark 1.1 (57.05) beat Muse Spark by 4.76&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PIIMB PII Masking - OpenPII F2&lt;/strong&gt;: OpenMed privacy-filter-nemotron-v2 (97.63) beat hivetrace gliner-guard-omni by 4.58&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - MCP Atlas&lt;/strong&gt;: Muse Spark 1.1 (88.1) beat Gemini 3.5 Flash (High) by 4.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PIIMB PII Masking - Avg F1&lt;/strong&gt;: OpenMed privacy-filter-multilingual-v2 (92.38) beat OpenMed OpenMed-PII-SuperClinical-Large-434M-v1 by 4.43&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE-Bench Pro (Private Dataset)&lt;/strong&gt;: Muse Spark 1.1 (51.5) beat Claude Opus 4.6 (Thinking) by 4.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Legal Research Bench&lt;/strong&gt;: GPT-5.6 Sol (48.08) beat Claude Opus 4.8 by 4.33&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KernelBench Hub - Hard&lt;/strong&gt;: GPT-5.6 Sol (30.0) beat GLM-5.2 by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - Kotlin&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (94.0) beat GPT-5.3 Codex (xHigh) by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - PHP&lt;/strong&gt;: GPT-5.6 Sol (96.0) beat GPT-5.5 (High) by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA CritPt&lt;/strong&gt;: GPT-5.6 Sol (32.29) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 3.72&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agents' Last Exam&lt;/strong&gt;: GPT-5 Sol (30.6) beat Claude Opus 4.8 by 3.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Terminal-Bench Hard&lt;/strong&gt;: GPT-5.6 Sol (65.91) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 3.03&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SWE-Marathon&lt;/strong&gt;: Grok 4.5 (29.0) beat Claude Opus 4.8 by 3.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PIIMB PII Masking - Gretel F2&lt;/strong&gt;: OpenMed privacy-filter-nemotron-v2 (98.28) beat OpenMed OpenMed-PII-SuperClinical-Small-44M-v1 by 2.99&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Excel Modeling&lt;/strong&gt;: GPT-5.6 Sol (72.34) beat Claude Opus 4.8 by 2.97&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PIIMB PII Masking - Avg F2&lt;/strong&gt;: OpenMed privacy-filter-multilingual-v2 (91.68) beat OpenMed OpenMed-PII-SuperClinical-Large-434M-v1 by 2.94&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GSO-Bench&lt;/strong&gt;: Claude Opus 4.8 (47.06) beat Claude Opus 4.7 by 2.94&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSWE&lt;/strong&gt;: GPT-5 Sol (72.7) beat Claude Fable 5 by 2.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Open Universal Arabic ASR Leaderboard&lt;/strong&gt;: cohere-transcribe-arabic-07-2026 (25.87) beat omniASR_LLM_7B by 2.45&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE-Bench Pro (Public Dataset)&lt;/strong&gt;: Muse Spark 1.1 (61.5) beat GPT-5.4 (xHigh) by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PM-LLM-Benchmark&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (40.2) beat Kimi K2.6 by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Paraphrase&lt;/strong&gt;: Llama 3.1 70B Instruct (82.25) beat Gemini 3.1 Pro (Preview) (High) by 2.38&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Story Generation&lt;/strong&gt;: Gemini 1.5 Flash (Preview 0827) (81.33) beat GPT-5.4 (xHigh) by 2.31&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI TaxEval v2&lt;/strong&gt;: Muse Spark 1.1 (79.72) beat Muse Spark by 2.04&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - HTML&lt;/strong&gt;: GPT-5.6 Sol (92.0) beat GPT-5.5 (High) by 2.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BenchLM&lt;/strong&gt;: Claude Fable 5 (91.0) beat Claude Mythos 5 by 2.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Health&lt;/strong&gt;: GPT-5.6 Sol (High) (50.7) beat Grok Build 0.1 by 1.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Critpt&lt;/strong&gt;: GPT-5.6 Sol (32.3) beat GPT-5.5 Pro (xHigh) by 1.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - Professional Reasoning Benchmark - Finance&lt;/strong&gt;: Muse Spark 1.1 (55.01) beat Claude Opus 4.6 (Non-reasoning) by 1.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Tau3 Banking&lt;/strong&gt;: GPT-5.6 Sol (32.99) beat GPT-5.5 (xHigh) by 1.65&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AMA-Bench - Embodied AI&lt;/strong&gt;: VeraKV (Qwen3-32B) (58.09) beat GPT-5.2 by 1.65&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FrontierMath - Tiers 1-3 (v2)&lt;/strong&gt;: GPT-5.6 Sol (89.12) beat GPT-5.5 Pro (xHigh) by 1.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TrackingAI IQ Test&lt;/strong&gt;: Claude Fable 5 (97.3) beat GPT-5 Pro by 1.22&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI SWE-bench Verified&lt;/strong&gt;: GPT-5.6 Sol (96.2) beat Claude Fable 5 by 1.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - TypeScript&lt;/strong&gt;: GPT-5.6 Sol (92.22) beat GPT-5.5 (xHigh) by 1.11&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Static&lt;/strong&gt;: World Dreamer (84.52) beat EvoPhys-World by 1.07&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Confirmed Success&lt;/strong&gt;: MiniMax-M2.7 (17.12) beat Claude Fable 5 (High) by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WeirdML&lt;/strong&gt;: GPT-5.6 Sol (High) (88.76) beat Claude Fable 5 (High) by 0.91&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI ProgramBench&lt;/strong&gt;: GPT-5.6 Sol (77.64) beat Claude Fable 5 by 0.84&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore&lt;/strong&gt;: World Dreamer (79.44) beat EvoPhys-World by 0.82&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AutomationBench&lt;/strong&gt;: GPT-5.6 Sol (18.1) beat Claude Fable 5.0 (Max) by 0.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GDP.pdf&lt;/strong&gt;: GPT-5.6 Sol (30.7) beat Claude Fable 5 by 0.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - ECI&lt;/strong&gt;: GPT-5.6 Sol (161.61) beat GPT-5.5 Pro (xHigh) by 0.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Open Universal Arabic ASR Leaderboard - CER&lt;/strong&gt;: cohere-transcribe-arabic-07-2026 (11.8) beat Qwen3-ASR-1.7B by 0.53&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - MultiNRC&lt;/strong&gt;: Muse Spark 1.1 (65.59) beat GPT-5 Pro by 0.39&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldCupBench - Brier Skill&lt;/strong&gt;: DeepSeek V4 Pro (85.1919) beat MiMo-V2.5-Pro by 0.37&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MedScribe&lt;/strong&gt;: Muse Spark 1.1 (88.89) beat Claude Fable 5 by 0.37&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Dynamic&lt;/strong&gt;: World Dreamer (74.35) beat Inspatio-World by 0.25&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Tool Hallucination&lt;/strong&gt;: Gemini 3 Flash (0.1) beat DeepSeek V4 Pro by 0.02&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-12

=== DAILY ===
NEW BENCHMARKS (1)
  - OpenCompass Language - Chat (Score (%)): leader Doubao-Seed-2-0-Pro-260215 (high) (91.7), 23 models

NEW SCORES FROM TOP-10 MODELS (10)
  - Claude Fable 5 on Lean AI Formalization Leaderboard: 4.0 Solved Problems (#13/35)
  - Cl</summary></entry><entry><title>The Aggregate Digest — 2026-07-11</title><id>https://theaggregate.ai/digest/2026-07-11</id><updated>2026-07-11T06:25:38.438783+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;Top-10 New Scores (16)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AutomationBench: 18.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Bullshit Benchmark: 27.3 (#59)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Chess Puzzles (Epoch AI): 64.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (Data Viz): 1341.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (Website): 1346.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Cursorbench: 67.2 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Scicode: 56.13 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on FrontierMath - Tier 4 (v2): 82.93 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LisanBench: 0.0721 (#45)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Mercor APEX: 40.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Mercor APEX: 40.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Ramp SWE-Bench: 82.28 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Senior SWE-Bench: 24.4 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on You're Absolutely Right!: 2.875 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Chatbot Arena (Code): 1540.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Chatbot Arena (Text): 1490.0 (#6)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;RuneBench&lt;/strong&gt;: GPT-5.6 Sol (7400.0) beat GPT-5.5 by 1030.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - scBench-Long&lt;/strong&gt;: GPT-5.6 Sol (42.5) beat Claude Opus 4.8 by 13.93&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Opus Magnum Bench&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (70.86) beat Claude Fable 5 (High) by 10.71&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WolfBench&lt;/strong&gt;: GPT-5.6 Sol (85.0) beat GPT-5.5 by 6.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agents' Last Exam&lt;/strong&gt;: GPT-5 Sol (30.6) beat Claude Opus 4.8 by 3.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Critpt&lt;/strong&gt;: GPT-5.6 Sol (32.3) beat GPT-5.5 Pro (xHigh) by 1.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WeirdML&lt;/strong&gt;: GPT-5.6 Sol (High) (88.76) beat Claude Fable 5 (High) by 0.91&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GDP.pdf&lt;/strong&gt;: GPT-5.6 Sol (30.7) beat Claude Fable 5 by 0.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - ECI&lt;/strong&gt;: GPT-5.6 Sol (161.61) beat GPT-5.5 Pro (xHigh) by 0.6&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-11

=== DAILY ===
NEW SCORES FROM TOP-10 MODELS (16)
  - GPT-5.6 Sol on AutomationBench: 18.1 Pass Rate (%) (#1/10)
  - GPT-5.6 Sol on Bullshit Benchmark: 27.3 BS Detection Rate (%) (#59/158)
  - GPT-5.6 Sol on Chess Puzzles (Epoch AI): 64.0 Accuracy (%) (#1/55)
  - GP</summary></entry><entry><title>The Aggregate Digest — 2026-07-10</title><id>https://theaggregate.ai/digest/2026-07-10</id><updated>2026-07-10T07:26:29.777517+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; — ELO 3315, #5&lt;ul&gt;&lt;li&gt;SEAL - MultiNRC: 65.59 (#1/44)&lt;/li&gt;&lt;li&gt;SEAL - VisualToolBench (VTB): 44.77 (#1/21)&lt;/li&gt;&lt;li&gt;SEAL - SWE-Bench Pro (Public Dataset): 61.5 (#1/25)&lt;/li&gt;&lt;li&gt;SEAL - SWE-Bench Pro (Private Dataset): 51.5 (#1/14)&lt;/li&gt;&lt;li&gt;SEAL - Professional Reasoning Benchmark - Finance: 55.01 (#1/29)&lt;/li&gt;&lt;li&gt;SEAL - Professional Reasoning Benchmark - Legal: 57.05 (#1/29)&lt;/li&gt;&lt;li&gt;SEAL - MCP Atlas: 88.1 (#1/24)&lt;/li&gt;&lt;li&gt;SEAL - MultiChallenge: 75.3 (#2/30)&lt;/li&gt;&lt;li&gt;SEAL - Fortress: 12.4 (#54/56)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (25)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on KernelBench Hub - Hard: 24.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on KernelBench Hub - Mega: 18.7 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on SEAL - Fortress: 12.4 (#54)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on SEAL - MultiChallenge: 75.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on SvelteBench: 92.2 (#36)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI (Vals Index): 68.41 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Code Migration: 31.11 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI CorpFin v2: 71.29 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Excel Modeling: 56.36 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Finance Agent v2: 57.21 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI GPQA: 91.16 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Legal Research Bench: 37.98 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI LegalBench: 84.98 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI LiveCodeBench: 85.91 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI MMLU-Pro: 88.73 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI MMMU: 86.59 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI MortgageTax: 66.14 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Multimodal Index: 66.74 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI ProgramBench: 16.16 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI ProofBench: 39.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Public Benefits Bench: 61.3 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI SAGE: 45.58 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI SWE-bench Verified: 82.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 69.29 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; on Vals AI Vibe Code Bench: 72.16 (#7)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (36)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;VoxelBench&lt;/strong&gt;: GPT-5.6 (2313.0) beat Claude Fable 5 (Max) by 130.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - VisualToolBench (VTB)&lt;/strong&gt;: Muse Spark 1.1 (44.77) beat GPT-5.4 by 15.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI IOI&lt;/strong&gt;: GPT-5.6 (86.67) beat Claude Fable 5 by 14.42&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE Atlas - Codebase QnA&lt;/strong&gt;: Claude Opus 4.8 (Claude Code) xhigh (57.26) beat Claude Opus 4.8 (Claude Code) by 8.47&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI CyberBench&lt;/strong&gt;: GPT-5.6 (88.14) beat GPT-5.5 by 7.63&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Harvey Legal Agent Bench&lt;/strong&gt;: muse-spark-1.1 (20.0) beat Grok 4.5 by 7.08&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Terminal-Bench 2.1&lt;/strong&gt;: GPT-5.6 (85.77) beat Claude Fable 5 by 5.25&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - Professional Reasoning Benchmark - Legal&lt;/strong&gt;: Muse Spark 1.1 (57.05) beat Muse Spark by 4.76&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - MCP Atlas&lt;/strong&gt;: Muse Spark 1.1 (88.1) beat Gemini 3.5 Flash (High) by 4.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE-Bench Pro (Private Dataset)&lt;/strong&gt;: Muse Spark 1.1 (51.5) beat Claude Opus 4.6 (Thinking) by 4.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Legal Research Bench&lt;/strong&gt;: GPT-5.6 (48.08) beat Claude Opus 4.8 by 4.33&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gert Labs Rankings&lt;/strong&gt;: GPT-5.6 (73.77) beat Claude Fable 5 by 4.19&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KernelBench Hub - Hard&lt;/strong&gt;: GPT-5.6 (30.0) beat GLM-5.2 by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - Kotlin&lt;/strong&gt;: GPT-5.6 (xHigh) (94.0) beat GPT-5.3 Codex (xHigh) by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - PHP&lt;/strong&gt;: GPT-5.6 (96.0) beat GPT-5.5 (Low) by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA CritPt&lt;/strong&gt;: GPT-5.6 (32.29) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 3.72&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Terminal-Bench Hard&lt;/strong&gt;: GPT-5.6 (65.91) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 3.03&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Excel Modeling&lt;/strong&gt;: GPT-5.6 (72.34) beat Claude Opus 4.8 by 2.97&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSWE&lt;/strong&gt;: GPT-5 (72.7) beat Claude Fable 5 by 2.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE-Bench Pro (Public Dataset)&lt;/strong&gt;: Muse Spark 1.1 (61.5) beat GPT-5.4 (xHigh) by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PM-LLM-Benchmark&lt;/strong&gt;: GPT-5.6 (xHigh) (40.2) beat Kimi K2.6 by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI TaxEval v2&lt;/strong&gt;: muse-spark-1.1 (79.72) beat Muse Spark by 2.04&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - HTML&lt;/strong&gt;: GPT-5.6 (92.0) beat GPT-5.5 (Medium) by 2.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Health&lt;/strong&gt;: GPT-5.6 (High) (50.7) beat Grok Build 0.1 by 1.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - Professional Reasoning Benchmark - Finance&lt;/strong&gt;: Muse Spark 1.1 (55.01) beat Claude Opus 4.6 (Non-reasoning) by 1.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FrontierMath - Tiers 1-3 (v2)&lt;/strong&gt;: GPT-5.6 (89.12) beat GPT-5.5 Pro (xHigh) by 1.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI SWE-bench Verified&lt;/strong&gt;: GPT-5.6 (96.2) beat Claude Fable 5 by 1.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - TypeScript&lt;/strong&gt;: GPT-5.6 (92.22) beat GPT-5.5 (xHigh) by 1.11&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Static&lt;/strong&gt;: World Dreamer (84.52) beat EvoPhys-World by 1.07&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI ProgramBench&lt;/strong&gt;: GPT-5.6 (77.64) beat Claude Fable 5 by 0.84&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore&lt;/strong&gt;: World Dreamer (79.44) beat EvoPhys-World by 0.82&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AutomationBench&lt;/strong&gt;: GPT-5.6 (18.1) beat Claude Fable 5.0 (Max) by 0.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Tau3 Banking&lt;/strong&gt;: GPT-5.6 (32.99) beat Grok 4.5 (High) by 0.41&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - MultiNRC&lt;/strong&gt;: Muse Spark 1.1 (65.59) beat GPT-5 Pro by 0.39&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MedScribe&lt;/strong&gt;: muse-spark-1.1 (88.89) beat Claude Fable 5 by 0.37&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WorldScore - Dynamic&lt;/strong&gt;: World Dreamer (74.35) beat Inspatio-World by 0.25&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-10

=== DAILY ===
NEW MODELS (1)
  - Muse Spark 1.1 — ELO 3315, #5/1465 (above: Claude Mythos Preview, below: Gemini 3 Deep Think)
      SEAL - MultiNRC: 65.59 (#1/44)
      SEAL - VisualToolBench (VTB): 44.77 (#1/21)
      SEAL - SWE-Bench Pro (Public Dataset): 61.5 (</summary></entry><entry><title>The Aggregate Digest — 2026-07-09</title><id>https://theaggregate.ai/digest/2026-07-09</id><updated>2026-07-09T08:28:35.747250+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Grok 4.5&lt;/strong&gt; — ELO 2494, #13&lt;ul&gt;&lt;li&gt;SWE-Marathon: 29.0 (#1/12)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 12.92 (#1/16)&lt;/li&gt;&lt;li&gt;Vals AI SWE-bench Verified: 86.6 (#3/66)&lt;/li&gt;&lt;li&gt;VoxelBench: 1796.0 (#4/44)&lt;/li&gt;&lt;li&gt;Vals AI MedScribe: 86.88 (#4/67)&lt;/li&gt;&lt;li&gt;Vals AI GPQA: 92.93 (#4/118)&lt;/li&gt;&lt;li&gt;Ramp SWE-Bench: 81.01 (#5/21)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 37.98 (#5/15)&lt;/li&gt;&lt;li&gt;Vals AI (Vals Index): 65.3 (#6/32)&lt;/li&gt;&lt;li&gt;BridgeBench Security: 81.7 (#7/34)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; on Agent Arena: 0.36 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; on Agent Arena - Bash Recovery: 7.91 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; on Agent Arena - Confirmed Success: 1.43 (#29)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; on Agent Arena - Praise vs Complaint: 0.52 (#31)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; on Agent Arena - Steerability: 5.2 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; on Agent Arena - Tool Hallucination: 1.02 (#14)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (7)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LiveBench Simplify&lt;/strong&gt;: Gemini 1.5 Flash (Preview 0827) (84.75) beat Gemini 3.1 Pro (Preview) (High) by 13.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TabArena All Tasks&lt;/strong&gt;: TabFM (default) (89.0) beat TabPFN-3 (default) by 11.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SWE-Marathon&lt;/strong&gt;: Grok 4.5 (29.0) beat Claude Opus 4.8 by 3.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Paraphrase&lt;/strong&gt;: Llama 3.1 70B Instruct (82.25) beat Gemini 3.1 Pro (Preview) (High) by 2.38&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Story Generation&lt;/strong&gt;: Gemini 1.5 Flash (Preview 0827) (81.33) beat GPT-5.4 (xHigh) by 2.31&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Harvey Legal Agent Bench&lt;/strong&gt;: Grok 4.5 (12.92) beat Claude Fable 5 by 1.67&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Tau3 Banking&lt;/strong&gt;: Grok 4.5 (High) (32.58) beat GPT-5.5 (xHigh) by 1.24&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-09

=== DAILY ===
NEW MODELS (1)
  - Grok 4.5 — ELO 2494, #13/1467 (above: Claude Opus 4.6, below: Claude Sonnet 5)
      SWE-Marathon: 29.0 (#1/12)
      Vals AI Harvey Legal Agent Bench: 12.92 (#1/16)
      Vals AI SWE-bench Verified: 86.6 (#3/66)
      VoxelBench: 1</summary></entry><entry><title>The Aggregate Digest — 2026-07-08</title><id>https://theaggregate.ai/digest/2026-07-08</id><updated>2026-07-08T07:17:07.129003+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New #1 Leaders (5)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;PIIMB PII Masking - OpenPII F2&lt;/strong&gt;: OpenMed privacy-filter-nemotron-v2 (97.63) beat hivetrace gliner-guard-omni by 4.58&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PIIMB PII Masking - Avg F1&lt;/strong&gt;: OpenMed privacy-filter-multilingual-v2 (92.38) beat OpenMed OpenMed-PII-SuperClinical-Large-434M-v1 by 4.43&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Senior SWE-Bench&lt;/strong&gt;: Claude Fable 5 (27.9) beat Claude Opus 4.8 by 3.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PIIMB PII Masking - Gretel F2&lt;/strong&gt;: OpenMed privacy-filter-nemotron-v2 (98.28) beat OpenMed OpenMed-PII-SuperClinical-Small-44M-v1 by 2.99&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PIIMB PII Masking - Avg F2&lt;/strong&gt;: OpenMed privacy-filter-multilingual-v2 (91.68) beat OpenMed OpenMed-PII-SuperClinical-Large-434M-v1 by 2.94&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-08

=== DAILY ===
NEW #1 LEADERS (5)
  - PIIMB PII Masking - OpenPII F2 (OpenPII F2 (%)): OpenMed privacy-filter-nemotron-v2 (97.63) beat hivetrace gliner-guard-omni (93.05) by 4.58
  - PIIMB PII Masking - Avg F1 (Average F1 (%)): OpenMed privacy-filter-multilingual-v2</summary></entry><entry><title>The Aggregate Digest — 2026-07-07</title><id>https://theaggregate.ai/digest/2026-07-07</id><updated>2026-07-07T08:03:20.636451+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SkillsBench&lt;/strong&gt; (With-skills score (%)): leader GPT-5.5 (67.3), 21 models&lt;br&gt;&lt;span&gt;SkillsBench (BenchFlow) evaluates how effectively agentic models use modular Skills — folders of instructions, scripts, and resources — to complete tasks across diverse domains; scored by task completion with the Skills available (the benchmark also reports skill-lift, the with-minus-without-Skills gain).&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Confirmed Success&lt;/strong&gt;: minimax-m2.7 MiniMax · Modified MIT (19.55) beat Claude Fable 5 (High) by 3.43&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-07-07

=== DAILY ===
NEW BENCHMARKS (1)
  - SkillsBench (With-skills score (%)): leader GPT-5.5 (67.3), 21 models
      SkillsBench (BenchFlow) evaluates how effectively agentic models use modular Skills — folders of instructions, scripts, and resources — to complete task</summary></entry></feed>