<?xml version="1.0" encoding="utf-8"?>
<?xml-stylesheet type="text/xsl" href="/feed.xsl"?>
<feed xmlns="http://www.w3.org/2005/Atom"><title>The Aggregate Digest</title><subtitle>AI benchmark changes — new models, leader shifts, and trends</subtitle><link href="https://theaggregate.ai/data/feed.xml" rel="self" /><link href="https://theaggregate.ai/whats-new?ref=atom" rel="alternate" /><id>https://theaggregate.ai/feed</id><icon>https://theaggregate.ai/favicon.svg</icon><updated>2026-09-05T08:57:04.372946+00:00</updated><entry><title>The Aggregate Digest — 2026-09-05</title><id>https://theaggregate.ai/digest/2026-09-05</id><updated>2026-09-05T08:57:04.372946+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (114)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Design Arena (ASCII Art)&lt;/strong&gt; (Elo): leader Claude Opus 5 (1382.0), 83 models&lt;br&gt;&lt;span&gt;Design Arena’s crowdsourced design comparison on ASCII-art prompts, where the whole artefact is text. Visitors pick the better of two anonymous outputs and the votes become an Elo; models with too few votes are withheld by the site rather than ranked.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Agents - Fullstack)&lt;/strong&gt; (Elo): leader Claude Opus 5 (1352.0), 42 models&lt;br&gt;&lt;span&gt;Design Arena’s crowdsourced design comparison on agent runs that have to deliver a working full-stack app. Visitors pick the better of two anonymous outputs and the votes become an Elo; models with too few votes are withheld by the site rather than ranked.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Agents - Mobile Apps)&lt;/strong&gt; (Elo): leader Claude Opus 5 (1348.0), 44 models&lt;br&gt;&lt;span&gt;Design Arena’s crowdsourced design comparison on agent runs that have to deliver a mobile app. Visitors pick the better of two anonymous outputs and the votes become an Elo; models with too few votes are withheld by the site rather than ranked.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Agents - Web Apps)&lt;/strong&gt; (Elo): leader Kimi K3 (1335.0), 40 models&lt;br&gt;&lt;span&gt;Design Arena’s crowdsourced design comparison on agent runs that have to deliver a web app. Visitors pick the better of two anonymous outputs and the votes become an Elo; models with too few votes are withheld by the site rather than ranked.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Code Completion&lt;/strong&gt; (Score): leader GPT-5.2 Codex (86.96), 54 models&lt;br&gt;&lt;span&gt;Partial code snippets requiring correct completion, measuring intent inference, pattern following, and syntactically valid continuations.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Code Generation&lt;/strong&gt; (Score): leader Claude Fable 5 (Max) (91.55), 54 models&lt;br&gt;&lt;span&gt;Programming problems from LeetCode and AtCoder requiring complete solutions from natural language specs, measuring algorithmic problem-solving.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Consecutive Events&lt;/strong&gt; (Score): leader Claude Sonnet 4.6 (Thinking, Medium) (92.68), 54 models&lt;br&gt;&lt;span&gt;Data analysis requiring detection and reasoning about sequences of events within structured datasets, measuring temporal pattern recognition.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Integrals With Game&lt;/strong&gt; (Score): leader GPT-5.6 Sol (Max) (100.0), 54 models&lt;br&gt;&lt;span&gt;Calculus integration problems combined with game theory scenarios, measuring interdisciplinary mathematical reasoning.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench JavaScript&lt;/strong&gt; (Score): leader Muse Spark 1.1 (xHigh) (77.27), 54 models&lt;br&gt;&lt;span&gt;JavaScript programming tasks requiring correct, executable code, measuring JS syntax, standard library usage, and web-oriented programming.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Logic With Navigation&lt;/strong&gt; (Score): leader Muse Spark 1.2 (xHigh) (88.0), 54 models&lt;br&gt;&lt;span&gt;Logic problems applied to 2D grid navigation, measuring combined deductive reasoning and spatial planning.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Python&lt;/strong&gt; (Score): leader Claude Opus 5 (Max) (75.0), 54 models&lt;br&gt;&lt;span&gt;Python programming tasks requiring correct and idiomatic solutions, measuring syntax knowledge and algorithmic implementation.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Spatial&lt;/strong&gt; (Score): leader Claude Opus 4.7 (xHigh) (100.0), 54 models&lt;br&gt;&lt;span&gt;Reasoning about 2D and 3D shapes and spatial relationships, measuring geometric visualization and mental rotation.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Theory of Mind&lt;/strong&gt; (Score): leader GPT-5.4 (xHigh) (88.46), 54 models&lt;br&gt;&lt;span&gt;Reasoning about beliefs, intentions, and mental states of individuals in scenarios, measuring social cognition.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench TypeScript&lt;/strong&gt; (Score): leader Claude Fable 5.1 (Max) (60.0), 54 models&lt;br&gt;&lt;span&gt;TypeScript programming tasks requiring type-safe implementations, measuring knowledge of TypeScript&amp;#x27;s type system and patterns.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - English)&lt;/strong&gt; (Arena Score): leader Claude Opus 4.6 (High) (1514.0), 400 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts are in English. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Chinese)&lt;/strong&gt; (Arena Score): leader Claude Opus 5 (Max) (1569.0), 371 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts are in Chinese. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - German)&lt;/strong&gt; (Arena Score): leader Gemini 3 Pro (1522.0), 296 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts are in German. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - French)&lt;/strong&gt; (Arena Score): leader Claude Fable 5 (1527.0), 278 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts are in French. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Spanish)&lt;/strong&gt; (Arena Score): leader Claude Fable 5 (1518.0), 279 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts are in Spanish. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Russian)&lt;/strong&gt; (Arena Score): leader Claude Fable 5 (1521.0), 364 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts are in Russian. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Japanese)&lt;/strong&gt; (Arena Score): leader Claude Fable 5 (1526.0), 261 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts are in Japanese. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Korean)&lt;/strong&gt; (Arena Score): leader Claude Fable 5 (1501.0), 265 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts are in Korean. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Coding)&lt;/strong&gt; (Arena Score): leader Claude Opus 4.7 (High) (1552.0), 395 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts ask for code. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Math)&lt;/strong&gt; (Arena Score): leader Claude Fable 5 (1529.0), 383 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts are mathematical. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Creative Writing)&lt;/strong&gt; (Arena Score): leader Claude Fable 5 (1504.0), 398 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts ask for creative writing. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Instruction Following)&lt;/strong&gt; (Arena Score): leader Claude Opus 4.6 (High) (1514.0), 400 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles whose prompts carry explicit instructions to obey. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Longer Query)&lt;/strong&gt; (Arena Score): leader Claude Opus 4.6 (High) (1524.0), 378 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to the longest-prompt subset of battles. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Multi-Turn)&lt;/strong&gt; (Arena Score): leader Muse Spark 1.2 (xHigh) (1518.0), 398 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to battles that ran past a single turn. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text - Hard Prompts)&lt;/strong&gt; (Arena Score): leader Claude Opus 4.6 (High) (1533.0), 400 models&lt;br&gt;&lt;span&gt;arena.ai’s text leaderboard restricted to the harder subset of battles, picked out by the site’s own difficulty classifier. It is the same crowd-vote Arena Score as the headline board, refitted over that category’s votes alone, so the ordering can differ from the overall table and the error bars are wider.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Vision - English)&lt;/strong&gt; (Arena Score): leader Claude Fable 5 (1309.0), 148 models&lt;br&gt;&lt;span&gt;arena.ai’s vision leaderboard restricted to battles whose prompts are in English. Same crowd-vote Arena Score as the headline vision board, refitted over that category’s votes alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Vision - Chinese)&lt;/strong&gt; (Arena Score): leader Claude Opus 5 (High) (1371.0), 115 models&lt;br&gt;&lt;span&gt;arena.ai’s vision leaderboard restricted to battles whose prompts are in Chinese. Same crowd-vote Arena Score as the headline vision board, refitted over that category’s votes alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Vision - Creative Writing)&lt;/strong&gt; (Arena Score): leader Gemini 3 Pro (1324.0), 87 models&lt;br&gt;&lt;span&gt;arena.ai’s vision leaderboard restricted to battles that ask for creative writing about an image. Same crowd-vote Arena Score as the headline vision board, refitted over that category’s votes alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Vision - Diagram)&lt;/strong&gt; (Arena Score): leader Claude Fable 5 (1362.0), 104 models&lt;br&gt;&lt;span&gt;arena.ai’s vision leaderboard restricted to battles whose images are diagrams and charts. Same crowd-vote Arena Score as the headline vision board, refitted over that category’s votes alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Vision - Humor)&lt;/strong&gt; (Arena Score): leader Claude Fable 5 (1331.0), 82 models&lt;br&gt;&lt;span&gt;arena.ai’s vision leaderboard restricted to battles that ask the model to read or make humour about an image. Same crowd-vote Arena Score as the headline vision board, refitted over that category’s votes alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Vision - OCR)&lt;/strong&gt; (Arena Score): leader Claude Fable 5 (1329.0), 104 models&lt;br&gt;&lt;span&gt;arena.ai’s vision leaderboard restricted to battles that ask the model to read text out of an image. Same crowd-vote Arena Score as the headline vision board, refitted over that category’s votes alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WebDev Arena (Frontend)&lt;/strong&gt; (Arena Score): leader Claude Fable 5.1 (Max) (1797.0), 125 models&lt;br&gt;&lt;span&gt;arena.ai’s WebDev Arena restricted to front-end builds: two models answer the same web-app prompt, the rendered results are shown side by side, and the votes are fitted to an Arena Score over that category alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WebDev Arena (Fullstack)&lt;/strong&gt; (Arena Score): leader Qwen 3.8 Max (1687.0), 58 models&lt;br&gt;&lt;span&gt;arena.ai’s WebDev Arena restricted to full-stack builds that need a backend as well as a UI: two models answer the same web-app prompt, the rendered results are shown side by side, and the votes are fitted to an Arena Score over that category alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WebDev Arena (HTML)&lt;/strong&gt; (Arena Score): leader Claude Opus 5 (Max) (1683.0), 124 models&lt;br&gt;&lt;span&gt;arena.ai’s WebDev Arena restricted to single-file HTML builds: two models answer the same web-app prompt, the rendered results are shown side by side, and the votes are fitted to an Arena Score over that category alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WebDev Arena (React)&lt;/strong&gt; (Arena Score): leader Claude Fable 5.1 (Max) (1811.0), 109 models&lt;br&gt;&lt;span&gt;arena.ai’s WebDev Arena restricted to React builds: two models answer the same web-app prompt, the rendered results are shown side by side, and the votes are fitted to an Arena Score over that category alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WebDev Arena (Reference-Based Design)&lt;/strong&gt; (Arena Score): leader Claude Fable 5.1 (Max) (1819.0), 124 models&lt;br&gt;&lt;span&gt;arena.ai’s WebDev Arena restricted to builds that have to reproduce a supplied reference design: two models answer the same web-app prompt, the rendered results are shown side by side, and the votes are fitted to an Arena Score over that category alone.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;E-Commerce Bench&lt;/strong&gt; (Final Assets (¥k, mean of 5 episodes)): leader GPT-5.6 Sol (Max) (1431.0), 18 models&lt;br&gt;&lt;span&gt;Eighteen agents are handed ¥100,000 each and told to run up to four simulated online stores for 365 days against real market data — sourcing, negotiating with suppliers, pricing, managing inventory and staying solvent. The score is end-of-year total assets averaged over five independent episodes, which is why the board spans three orders of magnitude and why two models went bankrupt in 2 of their 5 runs. Qwen, 2026.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Terminal-Bench 4.0&lt;/strong&gt; (Accuracy (%)): leader GPT-6 (58.2), 14 models&lt;br&gt;&lt;span&gt;Sixty-six containerized terminal tasks weighted toward science-adjacent and frontier engineering work, each agent run five times. Relative to 2.1 it lengthens timeouts and raises RAM and CPU on selected tasks, so a failure is more likely the agent&amp;#x27;s than the harness&amp;#x27;s.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Terminal-Bench 4.0 (Claude Code)&lt;/strong&gt; (Accuracy (%)): leader Claude Fable 5.1 (57.9), 6 models&lt;br&gt;&lt;span&gt;Terminal-Bench 4.0 restricted to the Claude Code harness, so the column compares models rather than scaffolds.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - SAGE&lt;/strong&gt; (Score (%)): leader Gemini 3.7 Flash (78.6), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is SAGE, spelling and grammatical error correction for Russian.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - Humor&lt;/strong&gt; (Score (%)): leader Gemini 3.7 Flash (58.6), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is Russian humour: reading a joke and picking or producing the funny reading.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - LIMUR&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (83.7), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is the LIMUR subtest.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - RUBIN&lt;/strong&gt; (Score (%)): leader Gemini 3.7 Flash (88.4), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is the RUBIN subtest.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - Riddles&lt;/strong&gt; (Score (%)): leader Gemini 3.7 Flash (71.9), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is Russian riddles, which resist retrieval because the answer is a pun rather than a fact.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - SOB-Hard&lt;/strong&gt; (Score (%)): leader GPT-5.6 Sol (93.9), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is the hard SOB split.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - Characters&lt;/strong&gt; (Score (%)): leader Gemini 3.7 Flash (64.3), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is character-level manipulation, where tokenisation rather than knowledge is the obstacle.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - Enantiosemy&lt;/strong&gt; (Score (%)): leader Grok 4.6 (70.8), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is enantiosemy, the Russian words that carry two opposite senses, disambiguated from context.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - GorillaHard&lt;/strong&gt; (Score (%)): leader Grok 4.6 (76.2), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is the hard split of API and function-calling selection.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - IFHardBench&lt;/strong&gt; (Score (%)): leader Gemini 3.7 Flash (95.8), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is hard instruction following, where the constraints are the difficulty.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - NewReasoning&lt;/strong&gt; (Score (%)): leader Gemini 3.7 Flash (82.6), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is the v2 reasoning refresh, built after the v1 reasoning tasks saturated.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - RussianRegions&lt;/strong&gt; (Score (%)): leader Gemini 3.7 Flash (20.6), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is regional knowledge of Russia, where models trained on Moscow-centric text lose ground.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - Reasoning&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (76.2), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is the general reasoning aggregate.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - Human Centric&lt;/strong&gt; (Score (%)): leader Gemini 3.7 Flash (64.7), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is the human-centric subset, judged against human preferences rather than a key.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - Agentic&lt;/strong&gt; (Score (%)): leader Grok 4.6 (85.5), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is agentic tool use and multi-step task completion in Russian.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2 - Culture Specific&lt;/strong&gt; (Score (%)): leader Gemini 3.7 Flash (52.3), 37 models&lt;br&gt;&lt;span&gt;MERA v2 is the second generation of the Russian MERA suite, rebuilt after the v1 tasks saturated; this board is questions that need Russian cultural context to answer.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - Total Score&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (87.2), 126 models&lt;br&gt;&lt;span&gt;The headline score of Nejumi 4, the Japanese LLM leaderboard run by Weights &amp;amp; Biases: a weighted blend of the general language performance (GLP) and alignment (ALT) halves.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP Average&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (86.68), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4’s general language performance half, averaged: the capability side of the Japanese leaderboard, spanning language, knowledge, reasoning, mathematics, coding, translation and function calling.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Applied Language&lt;/strong&gt; (Score (%)): leader Gemini 3.6 Flash (90.97), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the applied Japanese language use category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Reasoning&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (96.56), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the the reasoning aggregate category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Knowledge &amp; QA&lt;/strong&gt; (Score (%)): leader GPT-5.6 Sol (81.54), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the knowledge-grounded question answering category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Basic Language&lt;/strong&gt; (Score (%)): leader GPT-5.5 (87.8), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the basic Japanese language competence category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Application Development&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (80.38), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the application-level development tasks rather than single functions category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Expression&lt;/strong&gt; (Score (%)): leader Qwen 3.6 Max Preview (99.5), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the expressive Japanese writing category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Translation&lt;/strong&gt; (Score (%)): leader Claude Fable 5 (91.65), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the translation into and out of Japanese category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Information Retrieval&lt;/strong&gt; (Score (%)): leader Qwen 3.6 27B (82.46), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the retrieving the right fact from supplied material category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Abstract Reasoning&lt;/strong&gt; (Score (%)): leader GPT-5.6 Terra (98.0), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the abstract-pattern reasoning category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Logical Reasoning&lt;/strong&gt; (Score (%)): leader Inkling Small (98.5), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the logical reasoning category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Mathematical Reasoning&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (98.17), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the mathematical reasoning category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - General Knowledge&lt;/strong&gt; (Score (%)): leader Gemini 3.1 Pro (Preview) (85.56), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the general knowledge category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Specialized Knowledge&lt;/strong&gt; (Score (%)): leader Claude Fable 5 (81.39), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the specialised and professional knowledge category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Semantic Analysis&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (87.1), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the semantic analysis category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Syntactic Analysis&lt;/strong&gt; (Score (%)): leader GPT-5.5 (90.0), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the syntactic analysis category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Coding&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (90.81), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the code generation category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - GLP - Function Calling&lt;/strong&gt; (Score (%)): leader GPT-5.6 Sol (72.53), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), general language performance: the tool and function calling category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - ALT Average&lt;/strong&gt; (Score (%)): leader Qwen 3.6 Max Preview (91.81), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4’s alignment half, averaged: controllability, ethics, toxicity, bias, truthfulness and robustness. It is scored separately from the capability half because the two rank models differently.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - ALT - Controllability&lt;/strong&gt; (Score (%)): leader Grok 4.5 (94.73), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), alignment half: the controllability, meaning whether the model obeys format and constraint instructions category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - ALT - Ethics &amp; Morality&lt;/strong&gt; (Score (%)): leader Gemini 3.5 Flash (99.0), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), alignment half: the ethics and morality category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - ALT - Toxicity&lt;/strong&gt; (Score (%)): leader Claude Haiku 4.5 (88.21), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), alignment half: the toxicity category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - ALT - Bias&lt;/strong&gt; (Score (%)): leader Qwen 3.6 35B A3B (100.0), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), alignment half: the bias category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - ALT - Truthfulness&lt;/strong&gt; (Score (%)): leader Claude Opus 4.1 (88.5), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), alignment half: the truthfulness category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - ALT - Robustness&lt;/strong&gt; (Score (%)): leader Gemini 3.1 Pro (Preview) (100.0), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4 (Japanese, Weights &amp;amp; Biases), alignment half: the robustness to prompt perturbation category.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - jaster (0-shot)&lt;/strong&gt; (Score (%)): leader GPT-5.5 (88.02), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4’s jaster battery run zero-shot: a large collection of Japanese NLP datasets converted to a single evaluation harness.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - jaster (2-shot)&lt;/strong&gt; (Score (%)): leader Claude Fable 5 (88.63), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4’s jaster battery run with two in-context examples. The gap against the 0-shot board is the suite’s own measure of how much a model depends on demonstrations.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - MT-Bench (Japanese)&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (98.81), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4’s Japanese MT-Bench: multi-turn open-ended prompts graded by an LLM judge on the MT-Bench rubric, translated and re-authored for Japanese rather than machine translated.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nejumi 4 - SWE-Bench (Japanese)&lt;/strong&gt; (Score (%)): leader Claude Fable 5 (80.0), 126 models&lt;br&gt;&lt;span&gt;Nejumi 4’s Japanese SWE-Bench: real repository issues resolved end to end, with the issue text in Japanese. It is the hardest board in the suite and the one where the Japanese-specialised models fall furthest behind the frontier.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;E-commerce Last Exam&lt;/strong&gt; (Mean Reward (%)): leader Kimi K3 (56.74), 29 models&lt;br&gt;&lt;span&gt;FlyaiLab’s agentic shopping and travel benchmark: the agent has to complete a multi-step purchase or booking against a simulated storefront, and the score is mean reward over the episode rather than a pass or fail. This board is the overall configuration; the travel and e-commerce boards split it.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;E-commerce Last Exam - Travel&lt;/strong&gt; (Mean Reward (%)): leader Kimi K3 (48.11), 29 models&lt;br&gt;&lt;span&gt;E-commerce Last Exam restricted to travel episodes: itinerary search and booking against a simulated provider, scored by mean reward over the episode.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;E-commerce Last Exam - E-commerce&lt;/strong&gt; (Mean Reward (%)): leader Grok 4.5 (78.65), 29 models&lt;br&gt;&lt;span&gt;E-commerce Last Exam restricted to shopping episodes: search, compare, cart and checkout against a simulated storefront, scored by mean reward over the episode.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phare - Average Safety&lt;/strong&gt; (Score (%)): leader Claude Haiku 4.5 (83.16), 67 models&lt;br&gt;&lt;span&gt;Giskard’s Phare multilingual safety probe (English, French, Spanish), Average Safety module: the headline average over the four resistance modules below. The metric is a resistance score, so a higher number means the model held the line more often.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phare - Hallucination Resistance&lt;/strong&gt; (Score (%)): leader Claude Opus 4.5 (88.23), 71 models&lt;br&gt;&lt;span&gt;Giskard’s Phare multilingual safety probe (English, French, Spanish), Hallucination Resistance module: whether the model corrects a misleading premise instead of elaborating on it. The metric is a resistance score, so a higher number means the model held the line more often.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phare - Harm Resistance&lt;/strong&gt; (Score (%)): leader Claude Opus 4.6 (100.0), 71 models&lt;br&gt;&lt;span&gt;Giskard’s Phare multilingual safety probe (English, French, Spanish), Harm Resistance module: whether it declines requests for harmful content. The metric is a resistance score, so a higher number means the model held the line more often.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phare - Bias Resistance&lt;/strong&gt; (Score (%)): leader GPT-4.1 Mini (88.12), 67 models&lt;br&gt;&lt;span&gt;Giskard’s Phare multilingual safety probe (English, French, Spanish), Bias Resistance module: whether it reproduces stereotypes when the prompt invites one. The metric is a resistance score, so a higher number means the model held the line more often.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phare - Jailbreak Resistance&lt;/strong&gt; (Score (%)): leader Claude Sonnet 5 (86.84), 68 models&lt;br&gt;&lt;span&gt;Giskard’s Phare multilingual safety probe (English, French, Spanish), Jailbreak Resistance module: whether policy holds under jailbreak framing. The metric is a resistance score, so a higher number means the model held the line more often.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BenchX - Pass Rate&lt;/strong&gt; (Pass Rate (%)): leader GPT-5.6 Sol (82.94), 14 models&lt;br&gt;&lt;span&gt;Sawt-ML’s BenchX tests consent and boundary handling in Saudi dialect Arabic: the share of scenarios where the model respects the stated boundary instead of talking past it. Dialect matters here, because the polite-refusal conventions the score keys on are not the Modern Standard Arabic ones.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kivira k-bench&lt;/strong&gt; (Overall Score): leader GPT-5.5 (98.96), 33 models&lt;br&gt;&lt;span&gt;Kivira Health’s k-bench scores mental-health safety: how a model handles disclosure, crisis language and requests for clinical advice. The upstream board is one row per variant — system prompt crossed with reasoning level, 125 of them across 33 distinct models — and this board keeps each model’s best variant.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RAI-Bench - Refusal Rate (General)&lt;/strong&gt; (Rate (%)): leader Qwen3 235B A22B Thinking (2507) (86.0), 79 models&lt;br&gt;&lt;span&gt;GovTech Singapore’s RAI-Bench, localised undesired content (RabakBench): the share of general localised harmful prompts the model refuses. Written for Singapore deployment contexts, so the content is locally phrased rather than translated; higher is better.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RAI-Bench - Refusal Rate (Physics)&lt;/strong&gt; (Rate (%)): leader Claude Opus 4 (100.0), 78 models&lt;br&gt;&lt;span&gt;GovTech Singapore’s RAI-Bench, localised undesired content (RabakBench): the share of the physical-harm category the model refuses. Written for Singapore deployment contexts, so the content is locally phrased rather than translated; higher is better.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RAI-Bench - Refusal Rate (Career)&lt;/strong&gt; (Rate (%)): leader Claude Sonnet 4 (100.0), 78 models&lt;br&gt;&lt;span&gt;GovTech Singapore’s RAI-Bench, localised undesired content (RabakBench): the share of the career and employment category the model refuses. Written for Singapore deployment contexts, so the content is locally phrased rather than translated; higher is better.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RAI-Bench - Refusal Rate (JD)&lt;/strong&gt; (Rate (%)): leader Claude Opus 4 (100.0), 79 models&lt;br&gt;&lt;span&gt;GovTech Singapore’s RAI-Bench, localised undesired content (RabakBench): the share of the job-description category the model refuses. Written for Singapore deployment contexts, so the content is locally phrased rather than translated; higher is better.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RAI-Bench - RAG Robustness (LC Abstention)&lt;/strong&gt; (Rate (%)): leader Claude Sonnet 4 (97.0), 70 models&lt;br&gt;&lt;span&gt;GovTech Singapore’s RAI-Bench, out-of-knowledge-base robustness in the LC retrieval configuration: how often it abstains when the answer is not in the retrieved context. The pair is read together, because a model can score well on one by failing the other.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RAI-Bench - RAG Robustness (LC Factuality)&lt;/strong&gt; (Rate (%)): leader Claude Sonnet 4 (56.0), 70 models&lt;br&gt;&lt;span&gt;GovTech Singapore’s RAI-Bench, out-of-knowledge-base robustness in the LC retrieval configuration: how factual its answers are when it does answer. The pair is read together, because a model can score well on one by failing the other.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RAI-Bench - RAG Robustness (HY Abstention)&lt;/strong&gt; (Rate (%)): leader Gemini 2.5 Flash Lite (93.0), 70 models&lt;br&gt;&lt;span&gt;GovTech Singapore’s RAI-Bench, out-of-knowledge-base robustness in the HY retrieval configuration: how often it abstains when the answer is not in the retrieved context. The pair is read together, because a model can score well on one by failing the other.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RAI-Bench - RAG Robustness (HY Factuality)&lt;/strong&gt; (Rate (%)): leader O3 (49.0), 70 models&lt;br&gt;&lt;span&gt;GovTech Singapore’s RAI-Bench, out-of-knowledge-base robustness in the HY retrieval configuration: how factual its answers are when it does answer. The pair is read together, because a model can score well on one by failing the other.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Enkrypt AI - Risk Score&lt;/strong&gt; (Risk Score): leader Claude Fable 5 (0.0), 267 models&lt;br&gt;&lt;span&gt;Enkrypt AI’s LLM safety leaderboard: the composite risk score over all of its red-team suites. It is reported as a risk, so lower is better here and the leader is the least risky model rather than the most capable one.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Enkrypt AI - Safety Risk&lt;/strong&gt; (Risk Score): leader Claude Fable 5 (0.0), 265 models&lt;br&gt;&lt;span&gt;Enkrypt AI’s LLM safety leaderboard: how often the model produces unsafe content on red-team prompts. It is reported as a risk, so lower is better here and the leader is the least risky model rather than the most capable one.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Enkrypt AI - Bias Risk&lt;/strong&gt; (Risk Score): leader Claude Fable 5 (0.0), 267 models&lt;br&gt;&lt;span&gt;Enkrypt AI’s LLM safety leaderboard: measured bias in answers to demographically loaded prompts. It is reported as a risk, so lower is better here and the leader is the least risky model rather than the most capable one.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Enkrypt AI - Toxicity Risk&lt;/strong&gt; (Risk Score): leader Claude Fable 5 (0.0), 265 models&lt;br&gt;&lt;span&gt;Enkrypt AI’s LLM safety leaderboard: the rate of toxic output under provocation. It is reported as a risk, so lower is better here and the leader is the least risky model rather than the most capable one.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Enkrypt AI - Jailbreak Risk&lt;/strong&gt; (Risk Score): leader Claude Fable 5 (0.0), 265 models&lt;br&gt;&lt;span&gt;Enkrypt AI’s LLM safety leaderboard: how often a jailbreak attack gets the model past its own policy. It is reported as a risk, so lower is better here and the leader is the least risky model rather than the most capable one.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Enkrypt AI - Insecure Code Risk&lt;/strong&gt; (Risk Score): leader Claude Fable 5 (0.0), 267 models&lt;br&gt;&lt;span&gt;Enkrypt AI’s LLM safety leaderboard: the share of generated code carrying an exploitable weakness. It is reported as a risk, so lower is better here and the leader is the least risky model rather than the most capable one.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SuperCLUE-Law - Overall&lt;/strong&gt; (Score): leader Kimi K3 (92.07), 11 models&lt;br&gt;&lt;span&gt;SuperCLUE is the Chinese-language evaluation programme run by CLUE; its specialised boards each cover one professional domain and are graded by the organisers rather than self-reported. This board covers law: Chinese legal knowledge and reasoning.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (164)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench AMPS Hard: 99.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Connections: 99.33 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Math Comp: 95.1 (#35)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Olympiad: 92.84 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Paraphrase: 77.65 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Plot Unscrambling: 78.72 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Simplify: 72.03 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Story Generation: 71.7 (#28)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Summarize: 81.7 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Table Join: 56.13 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Table Reformat: 94.12 (#50)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Typos: 94.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench Zebra Puzzle: 100.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Chartography: 46.2 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on ClockBench: 53.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on ComplexConstraints: 45.1 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Design Arena (SVG): 1359.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on EnterpriseBench (CoreCraft Agents): 77.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Epoch AI - Ebr Bench: 47.62 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on GDP.pdf: 29.6 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on KernelBench Hub - CUDA: 106.27 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench AMPS Hard: 99.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Connections: 99.33 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Math Comp: 97.06 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Olympiad: 92.97 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Paraphrase: 71.52 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Plot Unscrambling: 75.17 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Simplify: 70.17 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Story Generation: 78.1 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Summarize: 72.17 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Table Join: 56.15 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Table Reformat: 94.12 (#53)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Typos: 94.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LiveBench Zebra Puzzle: 100.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Riemann-bench: 65.6 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on SEAL - MCP Atlas: 87.2 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI Code Migration: 54.61 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI ProgramBench: 82.69 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on WeirdML: 92.9 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on FutureEval: 15.41 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench AMPS Hard: 99.01 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Connections: 99.33 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Math Comp: 94.12 (#44)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Olympiad: 92.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Paraphrase: 65.73 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Plot Unscrambling: 74.73 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Simplify: 61.58 (#32)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Story Generation: 61.32 (#51)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Summarize: 66.43 (#38)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Table Join: 51.96 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Table Reformat: 94.12 (#51)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Typos: 92.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveBench Zebra Puzzle: 100.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AutomationBench: 41.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Benchmarks.bio - BioSecBench-Function: 35.1 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Benchmarks.bio - VariantBench: 48.6 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Coarena: 1000.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Coarena - Task Completion: 66.7 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on DeepsecBench: 37.79 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LM Market Cap LMC Score: 40.0 (#236)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench AMPS Hard: 98.0 (#33)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Connections: 100.0 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Math Comp: 97.06 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Olympiad: 92.17 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Paraphrase: 78.25 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Plot Unscrambling: 86.29 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Simplify: 70.53 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Story Generation: 73.98 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Summarize: 79.55 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Table Join: 58.37 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Table Reformat: 100.0 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Typos: 82.0 (#28)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LiveBench Zebra Puzzle: 100.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI (Vals Index): 66.61 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI BioMysteryBench: 79.26 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI Code Migration: 67.74 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI Excel Modeling: 71.7 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI Finance Agent v2: 53.54 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI Harvey Legal Agent Bench: 5.42 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI Legal Research Bench: 39.42 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI MedCode: 48.49 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI MedScribe: 87.91 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI ProgramBench: 85.42 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI ProofBench: 99.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI SAGE: 46.37 (#31)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 87.27 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vals AI Vibe Code Bench: 89.59 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on VoxelBench: 2656.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench AMPS Hard: 98.0 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Connections: 100.0 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Math Comp: 96.08 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Olympiad: 91.79 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Paraphrase: 78.07 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Plot Unscrambling: 66.36 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Simplify: 74.62 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Story Generation: 82.25 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Summarize: 84.77 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Table Join: 45.48 (#43)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Table Reformat: 98.04 (#39)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Typos: 90.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LiveBench Zebra Puzzle: 94.5 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on UGI - Natural Intelligence: 76.64 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on UGI - Willingness (W/10): 2.2 (#1134)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on UGI - Writing: 77.53 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on UGI Leaderboard: 47.02 (#209)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AutomationBench: 29.7 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Chartography: 42.5 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on ClockBench: 62.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on ComplexConstraints: 48.4 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Computer Anthology Terminal Tasks (Terminus-2): 51.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Deep20Bench: 13.14 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Design Arena (Data Viz): 1304.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Design Arena (Game Dev): 1344.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Design Arena (UI Components): 1368.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on GDP.pdf: 23.4 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on HANDBOOK.md Agents: 11.2 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench AMPS Hard: 99.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Connections: 100.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Math Comp: 95.1 (#38)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Olympiad: 92.16 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Paraphrase: 80.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Plot Unscrambling: 73.38 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Simplify: 75.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Story Generation: 82.75 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Summarize: 87.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Table Join: 45.33 (#44)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Table Reformat: 96.08 (#49)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Typos: 90.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LiveBench Zebra Puzzle: 98.25 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on ParseBench: 72.08 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Riemann-bench: 51.2 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on UGI - Natural Intelligence: 78.41 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on UGI - Willingness (W/10): 2.2 (#1137)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on UGI - Writing: 78.55 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on UGI Leaderboard: 46.71 (#213)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA-Briefcase: 54.87 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Chartography: 27.6 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Chatbot Arena (Code): 1618.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on ClockBench: 42.2 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on ComplexConstraints: 51.9 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on GDP.pdf: 27.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on HANDBOOK.md Agents: 15.4 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench AMPS Hard: 99.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Connections: 94.0 (#40)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Math Comp: 97.06 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Olympiad: 91.74 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Paraphrase: 78.62 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Plot Unscrambling: 68.38 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Simplify: 72.52 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Story Generation: 77.48 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Summarize: 83.4 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Table Join: 48.19 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Table Reformat: 100.0 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Typos: 86.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LiveBench Zebra Puzzle: 98.0 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Riemann-bench: 28.0 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on RuneBench: 2653.0 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Vals AI (Vals Index): 60.31 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Vals AI Excel Modeling: 62.71 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Vals AI Finance Agent v2: 58.9 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Vals AI Harvey Legal Agent Bench: 22.08 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Vals AI Legal Research Bench: 40.87 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 72.28 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Vals AI Vibe Code Bench: 82.86 (#6)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (25)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;RuneBench&lt;/strong&gt;: GPT-6 (34063.0) beat Grok 4.6 by 21306.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Zebra Puzzle&lt;/strong&gt;: GPT-5.5 (xHigh) (100.0) beat Claude 3.5 Sonnet (20240620) by 52.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench AMPS Hard&lt;/strong&gt;: Claude Opus 5 (Max) (99.01) beat Claude 3.5 Sonnet (20240620) by 50.01&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Math Comp&lt;/strong&gt;: Claude Opus 4.7 (xHigh) (98.04) beat Gemini 1.5 Pro (Preview 0827) by 43.87&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Connections&lt;/strong&gt;: Gemini 3.1 Pro (Preview) (High) (100.0) beat GPT-4o (2024-08-06) by 42.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Plot Unscrambling&lt;/strong&gt;: GPT-6 (Max) (86.29) beat Claude 3.5 Sonnet (20240620) by 31.15&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Table Reformat&lt;/strong&gt;: DeepSeek V4 Pro (100.0) beat GPT-4 Preview (0125) by 30.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Typos&lt;/strong&gt;: Claude Fable 5 (Max) (94.0) beat Claude 3 Opus (20240229) by 26.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Olympiad&lt;/strong&gt;: Claude Fable 5.1 (Max) (92.97) beat Gemini 1.5 Pro (Preview 0827) by 24.31&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Table Join&lt;/strong&gt;: GPT-6 (Max) (58.37) beat GPT-4o ChatGPT by 13.07&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Code Migration&lt;/strong&gt;: GPT-6 (Max) (67.74) beat Claude Opus 5 (Max) by 10.27&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AutomationBench&lt;/strong&gt;: GPT-6 (Max) (41.4) beat Claude Fable 5.1 with Opus 5 Fallback (Max) by 10.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseBench (CoreCraft Agents)&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort) (77.4) beat Claude Fable 5 (Adaptive Reasoning, Max Effort) by 7.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Game Dev)&lt;/strong&gt;: Claude Fable 5.1 (1430.0) beat Kimi K3 by 6.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Summarize&lt;/strong&gt;: Gemini 3.1 Pro (Preview) (High) (88.23) beat Llama 3.1 70B Instruct by 4.38&lt;/li&gt;&lt;li&gt;&lt;strong&gt;UGI - Writing&lt;/strong&gt;: Gemini 3.8 Flash (Thinking, Medium) (78.55) beat Claude Fable 5 (Adaptive Reasoning, High Effort) by 4.32&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - TxBench-AD&lt;/strong&gt;: GPT-6 (56.9) beat Claude Opus 5 by 3.94&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI ProgramBench&lt;/strong&gt;: GPT-6 (Max) (85.42) beat Claude Opus 5 (Max) by 3.15&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepsecBench&lt;/strong&gt;: GPT-6 (xHigh) (37.79) beat GPT-5.6 Sol (xHigh) by 2.21&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FutureEval&lt;/strong&gt;: Claude Opus 5 (High) (15.41) beat Claude Fable 5 (High) by 2.18&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Terminal-Bench 2.1&lt;/strong&gt;: GPT-6 (Max) (87.27) beat GPT-5.6 Sol (Max) by 1.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LiveBench Story Generation&lt;/strong&gt;: Gemini 3.8 Flash (High) (82.75) beat Gemini 1.5 Flash (Preview 0827) by 1.42&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ComplexConstraints&lt;/strong&gt;: Muse Spark 1.3 (xHigh) (51.9) beat GPT-5.6 Sol (Max) by 1.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chartography&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort) (46.2) beat GPT-5.6 Sol (Max) by 1.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WeirdML&lt;/strong&gt;: Claude Fable 5.1 (Max) (92.9) beat Claude Fable 5.1 (High) by 0.6&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-09-05

=== DAILY ===
NEW BENCHMARKS (114)
  - Design Arena (ASCII Art) (Elo): leader Claude Opus 5 (1382.0), 83 models
      Design Arena’s crowdsourced design comparison on ASCII-art prompts, where the whole artefact is text. Visitors pick the better of two anonymous out</summary></entry><entry><title>The Aggregate Digest — 2026-09-04</title><id>https://theaggregate.ai/digest/2026-09-04</id><updated>2026-09-04T05:07:34.915933+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Frontier&lt;/h2&gt;
&lt;ul&gt;&lt;li&gt;Best available model: GPT-6 (1815) takes the crown from Claude Fable 5.1 (1806)&lt;/li&gt;&lt;li&gt;Best measured model: GPT-6 (1815) takes the crown from Claude Fable 5.1 (1806)&lt;/li&gt;&lt;li&gt;Best available model: GPT-6 enters at #1 (1815 ELO) on 55 benchmarks&lt;/li&gt;&lt;li&gt;Best available model: Muse Spark 1.3 enters at #9 (1766 ELO) on 41 benchmarks&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (5)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - TxBench-AD&lt;/strong&gt; (Pass Rate (%)): leader Claude Opus 5 (52.96), 12 models&lt;br&gt;&lt;span&gt;Antibody discovery run end to end: 100 agentic evaluations spanning ten stages from target hypothesis and antigen design through binder generation, epitope and escape analysis, to preclinical candidate de-risking. Graded deterministically, and the whole board sits near 50 percent pass rate.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (ARC-AGI-3)&lt;/strong&gt; (Score (%)): leader GPT-6 (99.9), 5 models&lt;br&gt;&lt;span&gt;LLM Stats mirror of ARC Prize’s interactive-reasoning benchmark: an agent is dropped into a novel game environment with no instructions, no stated goal and no rules, and has to infer all three by playing. Six environments of eight to ten levels each, scored on levels completed with total actions as the tiebreaker — humans clear every one of them.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (ExploitGym)&lt;/strong&gt; (Score (%)): leader GPT-6 (42.4), 5 models&lt;br&gt;&lt;span&gt;LLM Stats mirror of ExploitGym, 898 exploit-development tasks built from real vulnerabilities in C/C++ userspace projects, Google’s V8 engine and the Linux kernel. The agent works a containerised target over multiple rounds under configurable mitigations, and a run only counts when it captures the flag and a judge confirms the exploit used the intended vulnerability rather than some other way in. UC Berkeley, MPI-SP, UC Santa Barbara and Arizona State, 2026.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Humanity's Last Exam (with tools, text-only))&lt;/strong&gt; (Score (%)): leader DeepSeek V4 Pro (0813) (60.0), 5 models&lt;br&gt;&lt;span&gt;LLM Stats mirror of Humanity’s Last Exam run two ways at once: tools enabled, and the multimodal questions dropped so the set is text alone. Both choices lift the numbers well above the bare no-tools board, so read this column against other tool-enabled runs rather than against plain HLE.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FrontierSWE V2&lt;/strong&gt; (Mean@5 Score (%)): leader Claude Fable 5.1 (56.3), 10 models&lt;br&gt;&lt;span&gt;The second FrontierSWE round, September 2026: 34 ultra-long-horizon tasks across implementation, performance engineering, scientific computing, visual reasoning and AI research — reimplementing git in Zig, decoding speech from MEG recordings, training a medium-range weather model. Each task gets a 20-hour budget and five runs, and the board reports the mean of those five rather than V1’s pairwise dominance.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; — ELO 1815, #1&lt;ul&gt;&lt;li&gt;DeepSWE: 74.1 (#1/31)&lt;/li&gt;&lt;li&gt;FrontierMath - Tier 4 (v2): 97.56 (#1/60)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 93.68 (#1/101)&lt;/li&gt;&lt;li&gt;ZeroEval GPQA Diamond: 96.0 (#1/247)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 169.23 (#1/585)&lt;/li&gt;&lt;li&gt;SimpleQA Verified: 75.6 (#1/78)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 72.0 (#1/220)&lt;/li&gt;&lt;li&gt;Epoch AI - Frontiermath Tiers 1 3 V2: 93.68 (#1/104)&lt;/li&gt;&lt;li&gt;Epoch AI - Frontiermath Tier 4 V2: 97.56 (#1/60)&lt;/li&gt;&lt;li&gt;Epoch AI - Ebr Bench: 76.19 (#1/20)&lt;/li&gt;&lt;li&gt;...and 44 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (72)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on FrontierCode: 64.9 (#54)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SEAL - Professional Reasoning Benchmark - Finance: 53.86 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SEAL - Professional Reasoning Benchmark - Legal: 52.56 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on FrontierCode: 63.6 (#49)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on OpenRouter GPQA Diamond: 82.7 (#52)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on OpenRouter Tau2-Bench Airline: 76.7 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on SEAL - Fortress: 13.72 (#50)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on SEAL - Humanity's Last Exam: 46.5 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on SEAL - Humanity's Last Exam (Text Only): 46.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on SEAL - Professional Reasoning Benchmark - Finance: 50.8 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on SEAL - Professional Reasoning Benchmark - Legal: 51.6 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on SpeechMap Compliance: 72.4 (#128)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Terminal-Bench 2.1: 57.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vending-Bench 2: 5421.56 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on VoxelBench: 1000.0 (#49)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on WeirdML: 92.3 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA CritPt: 31.71 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA GDPval: 1629.31 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA GPQA Diamond: 96.26 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA Humanity's Last Exam: 54.68 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA Long Context Reasoning: 76.33 (#51)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA MMMU-Pro: 86.88 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA Omniscience: 43.73 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA Omniscience - Business: 52.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA Omniscience - Health: 55.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 61.8 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA Omniscience - Law: 61.4 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 54.3 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 91.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA SciCode: 54.05 (#33)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA-Briefcase: 52.32 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on AA-Omniscience Accuracy: 62.6 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on ARC-AGI-1: 98.5 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on ARC-AGI-2: 95.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Artificial Analysis Intelligence Index: 61.22 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on BenchLM: 81.9 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on BenchmarkList ECI: 158.28 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Chess Puzzles (Epoch AI): 72.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on DeepSWE: 74.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Epoch AI - ECI: 169.23 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Epoch AI - Ebr Bench: 76.19 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Epoch AI - Frontiermath Tier 4 V2: 97.56 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Epoch AI - Frontiermath Tiers 1 3 V2: 93.68 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Epoch AI - Mirrorcode: 46.7 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Epoch AI - Mystery Game Puzzles: 84.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on FrontierCode: 64.5 (#52)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on FrontierMath - Tier 4 (v2): 97.56 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on FrontierMath - Tiers 1-3 (v2): 93.68 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LLM Stats (AutomationBench): 41.4 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LLM Stats (DeepSWE 1.1): 74.1 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LLM Stats (FrontierCode 1.1): 53.3 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LLM Stats (HealthBench Professional): 63.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on LLM Stats (OSWorld 2.0): 72.6 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Mercor APEX: 46.7 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on OTIS Mock AIME 2024-25: 100.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on SimpleQA Verified: 75.6 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Tau3 Banking: 43.09 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vellum - GPQA: 96.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on Vellum - Humanity's Last Exam: 57.2 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-6&lt;/strong&gt; on VoxelBench: 1000.0 (#48)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Chess (Saplin): 1107.1 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Terminal-Bench 2.1: 11.2 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Design Arena (3D): 1340.0 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on FrontierCode: 56.3 (#35)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Kaggle FACTS Grounding: 73.09 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LLM2014 Logic 2026-09: 62.05 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on SecIT Bench (Pydantic AI): 69.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on SimpleBench: 82.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Surface Evolver Bench: 76.88 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Surface Evolver Bench Pass Rate: 56.25 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on TaxCalcBench: 4.0 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Terminal-Bench 2.1: 19.1 (#10)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (49)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;ARC-AGI-3&lt;/strong&gt;: GPT-6 (Provider Adapter, High) (99.95) beat Claude Opus 5 (High) by 69.79&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Ebr Bench&lt;/strong&gt;: GPT-6 (Max) (76.19) beat Claude Opus 5 (Max) by 26.19&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Mystery Game Puzzles&lt;/strong&gt;: GPT-6 (Max) (84.0) beat Claude Opus 5 (Max) by 25.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (ExploitBench)&lt;/strong&gt;: GPT-6 (100.0) beat Claude Fable 5 by 22.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - FreshRetailNet T3&lt;/strong&gt;: TimeSeries Scientist (deepseek-chat) (34.09) beat AgentScope (gpt-4o) by 20.45&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - MIMIC T3&lt;/strong&gt;: TimeClaw (deepseek-v4-pro) (56.86) beat Single LLM (gpt-4o) by 20.25&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - CausalChambers T4&lt;/strong&gt;: TimeClaw (deepseek-v4-pro) (51.33) beat AgentScope (gpt-4o) by 19.33&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - T4&lt;/strong&gt;: TimeClaw (deepseek-v4-pro) (43.63) beat CAMEL (gpt-4o) by 15.71&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - PSML T4&lt;/strong&gt;: TimeClaw (deepseek-v4-pro) (50.0) beat Single LLM (gpt-4o) by 14.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - T3&lt;/strong&gt;: TimeClaw (deepseek-v4-pro) (42.18) beat Single LLM (gpt-4o) by 12.94&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - MIMIC T2&lt;/strong&gt;: TimeClaw (deepseek-v4-pro) (33.33) beat TimeSeries Scientist (gpt-4o) by 9.93&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FrontierMath - Tier 4 (v2)&lt;/strong&gt;: GPT-6 (Medium) (97.56) beat Claude Fable 5.1 (Max) by 9.76&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Frontiermath Tier 4 V2&lt;/strong&gt;: GPT-6 (Medium) (97.56) beat Claude Fable 5.1 (Max) by 9.76&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - T2&lt;/strong&gt;: TimeClaw (deepseek-v4-pro) (38.22) beat Single LLM (gpt-4o) by 8.38&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chess Puzzles (Epoch AI)&lt;/strong&gt;: GPT-6 (Max) (72.0) beat GPT-5.6 Pro Sol (Max) by 8.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench&lt;/strong&gt;: TimeClaw (deepseek-v4-pro) (41.8) beat Single LLM (gpt-4o) by 7.69&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Agents' Last Exam)&lt;/strong&gt;: GPT-6 (59.3) beat GPT-5.6 Sol by 6.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Terminal-Bench 2.1&lt;/strong&gt;: GPT-6 (58.2) beat Claude Opus 5 by 6.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - FreshRetailNet T1&lt;/strong&gt;: AgentScope (deepseek-chat) (70.45) beat CAMEL (gpt-4o) by 6.25&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Terminal-Bench 2.1 (Claude Code)&lt;/strong&gt;: Claude Fable 5.1 (57.9) beat Claude Opus 5 by 6.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - ECI&lt;/strong&gt;: GPT-6 (High) (169.23) beat Claude Fable 5 (High) by 6.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Multimodal - MathVista&lt;/strong&gt;: BlueLM-3.5-Nano-3B (88.3) beat SenseNova-V6-5-Pro by 5.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - PSML T1&lt;/strong&gt;: Single LLM (deepseek-chat) (74.0) beat CAMEL (gpt-4o) by 5.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (ScreenSpot Pro)&lt;/strong&gt;: GPT-6 (92.7) beat Claude Opus 4.8 by 4.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SimpleBench&lt;/strong&gt;: Claude Fable 5.1 (86.6) beat Claude Fable 5 by 4.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats Score&lt;/strong&gt;: GPT-6 (60.72) beat Claude Fable 5.1 by 3.82&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Multimodal - HallusionBench&lt;/strong&gt;: BlueLM-3.5-Nano-3B (70.5) beat SenseNova-V6-5-Pro by 3.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - CausalChambers T3&lt;/strong&gt;: TimeClaw (deepseek-v4-pro) (48.8) beat MetaGPT (gpt-4o) by 3.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FrontierMath - Tiers 1-3 (v2)&lt;/strong&gt;: GPT-6 (Max) (93.68) beat Claude Fable 5.1 (Max) by 3.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Frontiermath Tiers 1 3 V2&lt;/strong&gt;: GPT-6 (Max) (93.68) beat Claude Fable 5.1 (Max) by 3.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ParseBench&lt;/strong&gt;: Claude Fable 5.1 (78.92) beat KDL-Frontier-Parser-nano by 2.56&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vellum - ARC-AGI-2&lt;/strong&gt;: GPT-6 (95.0) beat GPT-5.6 Sol by 2.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SimpleQA Verified&lt;/strong&gt;: GPT-6 (Max) (75.6) beat Gemini 3.1 Pro (Preview) (High) by 2.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PutnamBench&lt;/strong&gt;: Humanfia (672.0) beat Humanfia (w/ GPT 5.5) by 2.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Terminal-Bench 4.0)&lt;/strong&gt;: GPT-6 (57.7) beat Claude Fable 5.1 by 1.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - PSML T3&lt;/strong&gt;: TimeClaw (deepseek-v4-pro) (36.4) beat Single LLM (gpt-4o) by 1.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - MIMIC T4&lt;/strong&gt;: CAMEL (deepseek-chat) (31.21) beat Single LLM (gpt-4o) by 1.42&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ZeroEval GPQA Diamond&lt;/strong&gt;: GPT-6 (96.0) beat GPT-5.6 Sol by 1.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Multimodal - MMBench&lt;/strong&gt;: BlueLM-3.5-Nano-3B (89.7) beat JT3.5 by 1.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA MMMU-Pro&lt;/strong&gt;: GPT-6 (Max) (86.88) beat Gemini 3.8 Flash (High) by 1.27&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA GPQA Diamond&lt;/strong&gt;: GPT-6 (xHigh) (96.26) beat Gemini 3.8 Flash (High) by 1.01&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Multimodal - MMStar&lt;/strong&gt;: BlueLM-3.5-Nano-3B (84.3) beat JT3.5 by 0.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WeirdML&lt;/strong&gt;: Claude Fable 5.1 (High) (92.3) beat Claude Fable 5 (Max) by 0.36&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSWE&lt;/strong&gt;: GPT-6 (xHigh) (74.1) beat Gemini 3 Flash by 0.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (BrowseComp)&lt;/strong&gt;: GPT-6 (91.5) beat Kimi K3 by 0.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience&lt;/strong&gt;: GPT-6 (High) (43.73) beat Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) by 0.28&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TemporalBench - T1&lt;/strong&gt;: TimeCopilot (deepseek-chat) (50.0) beat Single LLM (gpt-4o) by 0.28&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - Humanity's Last Exam&lt;/strong&gt;: Claude Fable 5.1 (xHigh) (46.5) beat Gemini 3.1 Pro (Preview) (High) by 0.06&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Blueprint-Bench 2&lt;/strong&gt;: Claude Fable 5.1 (0.419) beat Claude Fable 5 by 0.03&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-09-04

=== FRONTIER ===
  - Best available model: GPT-6 (1815) takes the crown from Claude Fable 5.1 (1806)
  - Best measured model: GPT-6 (1815) takes the crown from Claude Fable 5.1 (1806)
  - Best available model: GPT-6 enters at #1 (1815 ELO) on 55 benchmarks
  - Best</summary></entry><entry><title>The Aggregate Digest — 2026-09-03</title><id>https://theaggregate.ai/digest/2026-09-03</id><updated>2026-09-03T09:52:51.330313+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Frontier&lt;/h2&gt;
&lt;ul&gt;&lt;li&gt;Best measured model: Claude Fable 5.1 (1814) takes the crown from Claude Mythos 5 (1807)&lt;/li&gt;&lt;li&gt;Best available model: Gemini 3.8 Flash enters at #4 (1781 ELO) on 82 benchmarks&lt;/li&gt;&lt;li&gt;Best available model: Hy4 preview enters at #18 (1733 ELO) on 41 benchmarks&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (BioMysteryBench)&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (90.1), 5 models&lt;br&gt;&lt;span&gt;LLM Stats mirror of BioMysteryBench, which works models through hard molecular biology problems and reports both the difficult subset and the subset human experts managed to solve.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Terminal-Bench 4.0)&lt;/strong&gt; (Score (%)): leader Claude Fable 5.1 (55.8), 12 models&lt;br&gt;&lt;span&gt;LLM Stats mirror of Terminal-Bench 4.0: 66 containerized terminal tasks weighted toward science-adjacent and frontier engineering work. Relative to earlier releases it lengthens timeouts and raises RAM and CPU on selected tasks, so a failure is more likely the agent’s than the harness’s.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EdiTikZ&lt;/strong&gt; (Overall Edit Score (0-1)): leader GPT-5.5 (0.69), 14 models&lt;br&gt;&lt;span&gt;Edit an existing scientific figure the way a co-author asks for it, working on the TikZ source rather than the picture. Scored as the mean of five judged axes — tree-edit distance, drawing similarity, edit accuracy, spec compliance and visual quality — so a model that redraws the figure from scratch does not win on the one axis it happened to satisfy.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DroneCATS (Approaching)&lt;/strong&gt; (Success Rate (%)): leader Gemini 3.7 Flash (65.0), 8 models&lt;br&gt;&lt;span&gt;A multimodal model dropped straight into a drone&amp;#x27;s control loop with its entire action space declared in the prompt, told to fly to a described target. This is the approach task&amp;#x27;s success rate, and the ceiling is 65 percent — the frontier can see where to go far more reliably than it can get there.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; — ELO 1781, #3&lt;ul&gt;&lt;li&gt;AA GPQA Diamond: 95.25 (#1/604)&lt;/li&gt;&lt;li&gt;AA MMMU-Pro: 85.61 (#1/252)&lt;/li&gt;&lt;li&gt;LLM Stats (LVBench): 87.1 (#1/28)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 89.4 (#1/35)&lt;/li&gt;&lt;li&gt;Vals AI Finance Agent v2: 61.44 (#1/55)&lt;/li&gt;&lt;li&gt;BioMysteryBench Human-Difficult: 56.5 (#1/14)&lt;/li&gt;&lt;li&gt;LVBench: 87.8 (#1/43)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 61.4 (#1/42)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSWE 1.1): 73.7 (#2/30)&lt;/li&gt;&lt;li&gt;LLM Stats (GDP.pdf): 35.0 (#2/7)&lt;/li&gt;&lt;li&gt;...and 75 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; — ELO 1774&lt;ul&gt;&lt;li&gt;Tau3 Banking: 52.37 (#1/196)&lt;/li&gt;&lt;li&gt;LLM Stats (AutomationBench): 49.4 (#1/17)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSWE 1.1): 75.4 (#1/30)&lt;/li&gt;&lt;li&gt;LLM Stats (Job Bench): 64.9 (#1/8)&lt;/li&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 98.5 (#1/24)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 88.8 (#2/35)&lt;/li&gt;&lt;li&gt;LLM Stats (OSWorld 2.0): 66.9 (#3/10)&lt;/li&gt;&lt;li&gt;LLM Stats (GDPval-AA): 1754.0 (#4/9)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 94.14 (#5/604)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSearchQA): 89.4 (#5/10)&lt;/li&gt;&lt;li&gt;...and 20 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (144)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on NL2Repo: 70.2 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SWE Atlas: 39.0 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA-Briefcase: 55.35 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA-LCR: 80.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AI Chess Leaderboard (Continuation): 1357.0 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Agents on Rails: 92.1 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Arena AI Code: 1765.37 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Chatbot Arena (Code): 1765.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Chatbot Arena (Text): 1504.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Computer Anthology Terminal Tasks (Claude Code): 55.2 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Computer Anthology Terminal Tasks (Terminus-2): 62.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Creative Writing (Lechmazur): 4.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on CritPt: 29.7 (#211)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Deep20Bench: 12.11 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Design Arena (3D): 1409.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Design Arena (UI Components): 1377.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Design Arena (Website): 1330.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Epoch AI - Apex Agents: 44.4 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Epoch AI - Critpt: 31.14 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Epoch AI - Cursorbench: 73.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Epoch AI - ECI: 162.96 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Epoch AI - Proofbench: 100.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Epoch AI - Scicode: 62.04 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on KernelBench Hub - Mega: 15.84 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LMArena WebDev Arena: 1765.37 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on MineBench: 2040.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on TaxCalcBench: 38.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on WebDev Arena: 1765.37 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA-Briefcase: 53.84 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on BioMysteryBench Human-Difficult: 49.4 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Finance Agent v2: 58.6 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LVBench: 75.4 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SWE Atlas: 63.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agents on Rails: 71.4 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Epoch AI - Critpt: 14.29 (#48)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Epoch AI - Scicode: 57.87 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Finance Agent v2: 59.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA CritPt: 18.29 (#37)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA GDPval: 1545.45 (#35)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA GPQA Diamond: 95.25 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA Humanity's Last Exam: 47.82 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA Long Context Reasoning: 82.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA MMMU-Pro: 85.61 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA Omniscience: 29.55 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA Omniscience - Business: 45.7 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA Omniscience - Health: 44.6 (#33)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 54.1 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA Omniscience - Law: 60.1 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 53.3 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 69.8 (#41)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA SciCode: 54.4 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA-Briefcase: 42.12 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AA-Omniscience Accuracy: 54.6 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AI Chess Leaderboard (Continuation): 1071.0 (#44)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on AI Chess Leaderboard (Reasoning): 1547.0 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Agent Arena: 5.94 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Agent Arena - Bash Recovery: 4.46 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Agent Arena - Confirmed Success: 11.12 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Agent Arena - Praise vs Complaint: 14.78 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Agent Arena - Steerability: -1.43 (#36)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Agent Arena - Tool Hallucination: -0.78 (#28)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Arena AI Code: 1567.33 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Artificial Analysis Intelligence Index: 58.68 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on BenchLM: 75.4 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on BenchmarkList ECI: 148.9 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on BioMysteryBench Human-Solvable: 88.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Chatbot Arena (Code): 1567.0 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Chatbot Arena (Text): 1494.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Coarena: 1029.7 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Coarena - Task Completion: 76.9 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Design Arena (Website): 1311.0 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Epoch AI - Critpt: 18.29 (#34)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Epoch AI - Cursorbench: 69.2 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Epoch AI - Proofbench: 48.0 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Epoch AI - Scicode: 54.4 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on KernelBench Hub - CUDA: 36.37 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on KernelBench Hub - Mega: 2.74 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LLM Stats (CharXiv-R): 86.2 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LLM Stats (DeepSWE 1.1): 73.7 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LLM Stats (GDP.pdf): 35.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LLM Stats (GDPval-AA): 1545.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LLM Stats (LVBench): 87.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LLM Stats (OSWorld 2.0): 59.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LLM Stats Score: 51.79 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LM Market Cap LMC Score: 40.0 (#237)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LMArena Text Arena: 1493.74 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on LMArena WebDev Arena: 1567.33 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on MineBench: 1893.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on RuneBench: 9333.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on SvelteBench: 100.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Tau3 Banking: 45.77 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI (Vals Index): 62.25 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI BioMysteryBench: 62.22 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI Code Migration: 36.55 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI CyberBench: 43.75 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI Excel Modeling: 72.2 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI Finance Agent v2: 61.44 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI GPQA: 94.44 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI Harvey Legal Agent Bench: 10.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI Legal Research Bench: 38.94 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI LegalBench: 86.99 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI LiveCodeBench: 89.48 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI MMLU-Pro: 90.22 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI MMMU: 89.08 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI MedCode: 48.13 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI MedScribe: 84.5 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI MortgageTax: 65.34 (#44)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI ProgramBench: 71.9 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI ProofBench: 48.0 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI Public Benefits Bench: 65.29 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI SAGE: 35.06 (#57)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI SWE-bench Verified: 80.0 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI SkillsBench: 57.98 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI TaxEval v2: 74.45 (#36)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 81.27 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on Vals AI Vibe Code Bench: 78.65 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on VoxelBench: 1816.0 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.8 Flash&lt;/strong&gt; on WebDev Arena: 1567.33 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA CritPt: 26.0 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA GDPval: 1753.92 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA GPQA Diamond: 94.14 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA Humanity's Last Exam: 49.07 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA Long Context Reasoning: 79.33 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA MMMU-Pro: 82.02 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA Omniscience: 24.93 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA Omniscience - Business: 38.3 (#50)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA Omniscience - Health: 37.4 (#76)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 39.9 (#74)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA Omniscience - Law: 38.3 (#58)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 46.9 (#49)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 62.2 (#72)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA SciCode: 58.56 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on AA-Omniscience Accuracy: 43.83 (#62)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Artificial Analysis Intelligence Index: 62.09 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on BenchmarkList ECI: 147.74 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Coarena: 1000.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Coarena - Task Completion: 0.0 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LLM Stats (DeepSearchQA): 89.4 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LLM Stats (GDPval-AA): 1754.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LLM Stats (OSWorld 2.0): 66.9 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LLM Stats (Terminal-Bench 2.1): 88.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on LM Market Cap LMC Score: 80.8 (#80)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on MineBench: 1832.0 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.3&lt;/strong&gt; on Tau3 Banking: 52.37 (#1)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (32)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Code)&lt;/strong&gt;: Claude Fable 5.1 (Max) (1765.0) beat Claude Opus 5 (Max) by 77.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WebDev Arena&lt;/strong&gt;: Claude Fable 5.1 (Max) (1765.37) beat Claude Opus 5 (Max) by 74.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Arena AI Code&lt;/strong&gt;: Claude Fable 5.1 (Max) (1765.37) beat Claude Opus 5 (Max) by 74.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LMArena WebDev Arena&lt;/strong&gt;: Claude Fable 5.1 (Max) (1765.37) beat Claude Opus 5 (Max) by 74.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Data Viz)&lt;/strong&gt;: Claude Fable 5.1 (1382.0) beat Kimi K3 by 12.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM2014 Logic 2026-09&lt;/strong&gt;: Claude Fable 5.1 (xhigh ~Estimated) (81.33) beat GPT-5.6 Sol (xHigh) by 11.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BioMysteryBench Human-Difficult&lt;/strong&gt;: Gemini 3.8 Flash (56.5) beat GPT-5.6 Terra by 7.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE Atlas - Test Writing&lt;/strong&gt;: Claude Fable 5.1 (Claude Code) xHigh (67.04) beat Claude Opus 5 (Claude Code) xHigh by 4.82&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Job Bench)&lt;/strong&gt;: Muse Spark 1.3 (64.9) beat Hy4 preview by 3.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Finance Agent v2&lt;/strong&gt;: Gemini 3.8 Flash (61.4) beat Claude Opus 5 (Max) by 2.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Cursorbench&lt;/strong&gt;: Claude Fable 5.1 (Max) (73.4) beat Grok 4.6 (xHigh) by 2.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BioMysteryBench Human-Solvable&lt;/strong&gt;: Claude Opus 5 (90.1) beat Claude Sonnet 5 by 2.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;NL2Repo&lt;/strong&gt;: Claude Opus 5 (72.3) beat Claude Opus 4.8 by 2.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Apex Agents&lt;/strong&gt;: Claude Fable 5.1 (Unknown) (47.4) beat Claude Fable 5 by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (DeepSWE 1.1)&lt;/strong&gt;: Muse Spark 1.3 (75.4) beat GPT-5.6 Sol by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LVBench&lt;/strong&gt;: Gemini 3.8 Flash (87.8) beat Gemini 3.7 Flash by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SWE Atlas&lt;/strong&gt;: Qwen3.8 Max 0902 (66.3) beat Hy4 preview claude-code by 2.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE Atlas - Refactoring&lt;/strong&gt;: Claude Fable 5.1 (Claude Code) xHigh (56.67) beat Claude Fable 5 (Claude Code) xHigh by 1.91&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Scicode&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (62.04) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 1.85&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (CyberGym)&lt;/strong&gt;: Gemini 3.8 Flash Cyber (86.2) beat GLM-5.3 by 1.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (MRCR v2 (8-needle))&lt;/strong&gt;: Muse Spark 1.3 (98.5) beat Gemini 3.7 Flash by 1.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Computer Anthology Terminal Tasks (Claude Code)&lt;/strong&gt;: Claude Fable 5.1 (High) (55.2) beat Claude Fable 5 (High) by 1.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Thinkingbox&lt;/strong&gt;: Claude Opus 5 (66.5) beat GPT-5.4 by 1.14&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Tau3 Banking&lt;/strong&gt;: Muse Spark 1.3 (Max) (52.37) beat Qwen 3.8 Max by 1.03&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Proofbench&lt;/strong&gt;: Claude Fable 5.1 (Max) (100.0) beat Claude Opus 5 (Max) by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Finance Agent v2&lt;/strong&gt;: Gemini 3.8 Flash (High) (61.44) beat Muse Spark 1.2 (xHigh) by 0.84&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (AutomationBench)&lt;/strong&gt;: Muse Spark 1.3 (49.4) beat GLM-5.3 Flash by 0.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Terminal-Bench 2.1)&lt;/strong&gt;: Gemini 3.8 Flash (89.4) beat GPT-5.6 Sol by 0.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Computer Anthology Terminal Tasks (Terminus-2)&lt;/strong&gt;: Claude Fable 5.1 (High) (62.4) beat Claude Opus 5 (High) by 0.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA GPQA Diamond&lt;/strong&gt;: Gemini 3.8 Flash (High) (95.25) beat Grok 4.6 (High) by 0.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gert Labs Rankings&lt;/strong&gt;: Claude Fable 5.1 (74.46) beat Claude Opus 5 by 0.28&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA MMMU-Pro&lt;/strong&gt;: Gemini 3.8 Flash (High) (85.61) beat Gemini 3.7 Flash (High) by 0.12&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-09-03

=== FRONTIER ===
  - Best measured model: Claude Fable 5.1 (1814) takes the crown from Claude Mythos 5 (1807)
  - Best available model: Gemini 3.8 Flash enters at #4 (1781 ELO) on 82 benchmarks
  - Best available model: Hy4 preview enters at #18 (1733 ELO) on 41 be</summary></entry><entry><title>The Aggregate Digest — 2026-09-02</title><id>https://theaggregate.ai/digest/2026-09-02</id><updated>2026-09-02T04:57:11.198104+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Frontier&lt;/h2&gt;
&lt;ul&gt;&lt;li&gt;Best available model: Claude Fable 5.1 (1809) takes the crown from Claude Opus 5 (1786)&lt;/li&gt;&lt;li&gt;Best available model: Claude Fable 5.1 enters at #1 (1809 ELO) on 66 benchmarks&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Frontiermath Tiers 1 3 V2&lt;/strong&gt; (Score): leader Claude Fable 5.1 (Max) (90.18), 103 models&lt;br&gt;&lt;span&gt;The three lower tiers of Epoch&amp;#x27;s FrontierMath v2, spanning advanced undergraduate mathematics up through early-career research problems. Every question is original and vetted by working mathematicians, and this is the wide end of the board — a hundred-odd models, and the frontier now clears 90.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - Frontiermath Tier 4 V2&lt;/strong&gt; (Score): leader Claude Fable 5.1 (Max) (87.8), 54 models&lt;br&gt;&lt;span&gt;Tier 4 of Epoch&amp;#x27;s FrontierMath v2: the research-level problems a working mathematician would need hours to solve. Held separately from tiers 1–3 because it is the part that was supposed to stay hard, and the top of the board has moved from single digits to the high eighties in under a year.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MERA v2&lt;/strong&gt; (Total score): leader Gemini 3.7 Flash (0.68), 37 models&lt;br&gt;&lt;span&gt;The 2.0 text suite that replaced MERA v1 as the default board at mera.a-ai.ru: twelve newly written Russian tasks (SAGE, Humor, LIMUR, RUBIN, Riddles, SOB-Hard, Characters, Enantiosemy and four more) scored 0-1 as a total over the set. Answers stay private and submissions are run by the organisers, so the task mix differs from v1 and the two scores are not comparable.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GDP.pdf&lt;/strong&gt; (Strict Pass Rate (%)): leader GPT-5.6 Sol (Max) (30.7), 34 models&lt;br&gt;&lt;span&gt;Surge AI multimodal document-reasoning benchmark over native professional PDF pages containing visually structured layouts, tables, charts, and forms across finance, healthcare, legal, engineering, insurance, and related domains.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; — ELO 1809, #1&lt;ul&gt;&lt;li&gt;CursorBench 3.1: 73.4 (#1/50)&lt;/li&gt;&lt;li&gt;FrontierMath - Tier 4 (v2): 87.8 (#1/54)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 90.18 (#1/100)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 100.0 (#1/287)&lt;/li&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 65.65 (#1/618)&lt;/li&gt;&lt;li&gt;AA Humanity's Last Exam: 59.13 (#1/590)&lt;/li&gt;&lt;li&gt;AA SciCode: 62.04 (#1/590)&lt;/li&gt;&lt;li&gt;AA Omniscience: 43.45 (#1/502)&lt;/li&gt;&lt;li&gt;AA GDPval: 1853.05 (#1/226)&lt;/li&gt;&lt;li&gt;AA-Briefcase: 61.52 (#1/31)&lt;/li&gt;&lt;li&gt;...and 54 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (68)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on MILU: 92.9 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA CritPt: 31.14 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA GDPval: 1853.05 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA GPQA Diamond: 93.74 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA Humanity's Last Exam: 59.13 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA Long Context Reasoning: 80.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA Omniscience: 43.45 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA Omniscience - Business: 57.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA Omniscience - Health: 57.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 66.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA Omniscience - Law: 68.6 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 62.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 92.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA SciCode: 62.04 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA-Briefcase: 61.52 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AA-Omniscience Accuracy: 67.23 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on AI Chess Leaderboard (Reasoning): 1428.0 (#28)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on ARC-AGI-1: 97.5 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on ARC-AGI-2: 90.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Artificial Analysis Intelligence Index: 65.65 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on BenchLM: 82.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on BenchmarkList ECI: 157.38 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Chess Puzzles (Epoch AI): 47.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Coarena: 1002.8 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Coarena - Task Completion: 29.4 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on CursorBench 3.1: 73.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Epoch AI - Mystery Game Puzzles: 58.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on FrontierMath - Tier 4 (v2): 87.8 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on FrontierMath - Tiers 1-3 (v2): 90.18 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Harvey Legal Agent Benchmark: 19.09 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LLM Stats (AutomationBench): 31.4 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LLM Stats Score: 54.8 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on LM Market Cap LMC Score: 97.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on MILU: 93.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on OTIS Mock AIME 2024-25: 100.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on RuneBench: 9813.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Senior SWE-Bench: 34.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on SimpleQA Verified: 70.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Tau3 Banking: 47.22 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Toolathlon: 77.8 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI (Vals Index): 67.87 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI Excel Modeling: 76.67 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI Finance Agent v2: 58.88 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI GPQA: 93.43 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI Harvey Legal Agent Bench: 6.67 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI Legal Research Bench: 55.29 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI LegalBench: 88.51 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI LiveCodeBench: 90.52 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI MMLU-Pro: 92.38 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI MMMU: 90.64 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI MedCode: 53.51 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI MedScribe: 91.29 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI MortgageTax: 70.79 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI ProofBench: 100.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI Public Benefits Bench: 74.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI ReverseEngBench: 22.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI SAGE: 48.53 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI SkillsBench: 61.55 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI TaxEval v2: 75.96 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 85.02 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5.1&lt;/strong&gt; on Vals AI Vibe Code Bench: 90.26 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Mythos 5&lt;/strong&gt; on Toolathlon: 79.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Mythos Preview&lt;/strong&gt; on BenchmarkList ECI: 155.94 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA-Omniscience Net Score: 49.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on MILU: 92.1 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Toolathlon: 80.6 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AutomationBench: 26.3 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ProteinGym Hard: 35.5 (#9)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (25)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (GDPval-AA)&lt;/strong&gt;: Claude Fable 5.1 (1853.0) beat GLM-5.3 Flash by 80.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA GDPval&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (1853.05) beat Claude Opus 5 (Adaptive Reasoning, Max Effort) by 29.11&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (OSWorld 2.0)&lt;/strong&gt;: Claude Fable 5.1 (77.9) beat Claude Opus 5 by 7.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Health&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (57.4) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 3.68&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Humanity's Last Exam&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (59.13) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 3.66&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA-Briefcase&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (61.52) beat Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) by 3.54&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Excel Modeling&lt;/strong&gt;: Claude Fable 5.1 (Max) (76.67) beat Claude Fable 5 (Max) by 3.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CursorBench 3.1&lt;/strong&gt;: Claude Fable 5.1 (Max) (73.4) beat Grok 4.6 (xHigh) by 2.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Artificial Analysis Intelligence Index&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (65.65) beat Claude Opus 5 (Adaptive Reasoning, Max Effort) by 2.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Law&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (68.6) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mercor APEX&lt;/strong&gt;: Claude Fable 5.1 (47.4) beat Claude Fable 5 by 2.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA-Omniscience Accuracy&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (67.23) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 1.88&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA SciCode&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (62.04) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 1.85&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Humanities &amp; Social Sciences&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (66.1) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 1.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE)&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (92.4) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 1.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FrontierMath - Tiers 1-3 (v2)&lt;/strong&gt;: Claude Fable 5.1 (Max) (90.18) beat GPT-5.6 Sol (Max) by 1.06&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AutomationBench&lt;/strong&gt;: Claude Fable 5.1 with Opus 5 Fallback (Max) (31.4) beat Gemini 3.7 Flash (High) by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MMLU-Pro&lt;/strong&gt;: Claude Fable 5.1 (Max) (92.38) beat Claude Opus 5 (Max) by 0.79&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MMMU&lt;/strong&gt;: Claude Fable 5.1 (Max) (90.64) beat Claude Opus 5 (Max) by 0.76&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI LiveCodeBench&lt;/strong&gt;: Claude Fable 5.1 (Max) (90.52) beat Claude Fable 5 (Max) by 0.74&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Science, Engineering &amp; Mathematics&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (62.0) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 0.72&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI (Vals Index)&lt;/strong&gt;: Claude Fable 5.1 (Max) (67.87) beat Claude Opus 5 (Max) by 0.66&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI MedScribe&lt;/strong&gt;: Claude Fable 5.1 (Max) (91.29) beat Claude Opus 5 (Max) by 0.31&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vellum - Humanity's Last Exam&lt;/strong&gt;: Claude Fable 5.1 (65.0) beat Claude Opus 5 by 0.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience&lt;/strong&gt;: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (43.45) beat Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) by 0.15&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-09-02

=== FRONTIER ===
  - Best available model: Claude Fable 5.1 (1809) takes the crown from Claude Opus 5 (1786)
  - Best available model: Claude Fable 5.1 enters at #1 (1809 ELO) on 66 benchmarks

=== DAILY ===
NEW BENCHMARKS (4)
  - Epoch AI - Frontiermath Tiers 1 3 </summary></entry><entry><title>The Aggregate Digest — 2026-09-01</title><id>https://theaggregate.ai/digest/2026-09-01</id><updated>2026-09-01T05:45:14.477929+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LLM2014 Logic 2026-09&lt;/strong&gt; (Median Score): leader GPT-5.6 Sol (xHigh) (70.03), 43 models&lt;br&gt;&lt;span&gt;September 2026 monthly snapshot of the LLM2014 project public leaderboard, scoring models on logic and reasoning problems from its continuously updated test set.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Mythos 5&lt;/strong&gt; on ExploitGym: 247.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on ExploitGym: 191.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI ReverseEngBench: 4.58 (#3)&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-09-01

=== DAILY ===
NEW BENCHMARKS (1)
  - LLM2014 Logic 2026-09 (Median Score): leader GPT-5.6 Sol (xHigh) (70.03), 43 models
      September 2026 monthly snapshot of the LLM2014 project public leaderboard, scoring models on logic and reasoning problems from its continu</summary></entry><entry><title>The Aggregate Digest — 2026-08-31</title><id>https://theaggregate.ai/digest/2026-08-31</id><updated>2026-08-31T09:08:07.449360+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (SWE-Marathon)&lt;/strong&gt; (Score (%)): leader GLM-5.3 (42.5), 5 models&lt;br&gt;&lt;span&gt;llm-stats.com’s mirror of SWE-Marathon, the ultra-long-horizon software-engineering benchmark whose tasks run to building compilers, optimizing kernels and standing up production-grade services. It measures whether an agent holds quality across an extremely long trajectory; the roster here is self-reported and much smaller than the first-party board.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Vision2Web)&lt;/strong&gt; (Score (%)): leader Qwen 3.8 Max (69.0), 5 models&lt;br&gt;&lt;span&gt;llm-stats.com’s mirror of Vision2Web, which asks multimodal models to turn a visual design or screenshot into a working web page and scores the end-to-end design-to-code result. Scores are self-reported and the roster is currently almost entirely one vendor’s models, so it reads as a vendor-reported slice rather than a broad comparison.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BenchmarkList ECI&lt;/strong&gt; (Capability Index (ECI)): leader Claude Mythos 5 (162.93), 506 models&lt;br&gt;&lt;span&gt;benchmarklist.com&amp;#x27;s site-wide capability index, the primary ranking score of its model directory. Despite the “ECI” label it is benchmarklist&amp;#x27;s own fit rather than Epoch&amp;#x27;s index republished — it correlates at about r=0.74 with Epoch&amp;#x27;s ECI on their shared models, with per-model gaps up to ~41 points, and scores far more models. Like LLM Stats Score and BenchGecko Score it is one aggregator&amp;#x27;s fused view, not an independent measurement.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Job Bench)&lt;/strong&gt;: Hy4 preview (61.7) beat Qwen3.8-Flash-Next by 6.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (WideSearch)&lt;/strong&gt;: Hy4 preview (83.9) beat Qwen 3.8 Max by 2.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (CritPT)&lt;/strong&gt;: Hy4 preview (16.9) beat GLM-5.2 by 0.2&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-31

=== DAILY ===
NEW BENCHMARKS (3)
  - LLM Stats (SWE-Marathon) (Score (%)): leader GLM-5.3 (42.5), 5 models
      llm-stats.com’s mirror of SWE-Marathon, the ultra-long-horizon software-engineering benchmark whose tasks run to building compilers, optimizing kernels </summary></entry><entry><title>The Aggregate Digest — 2026-08-30</title><id>https://theaggregate.ai/digest/2026-08-30</id><updated>2026-08-30T10:45:53.611904+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;Top-10 New Scores (15)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Appwrite Arena (With Skills): 97.4 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Appwrite Arena (Without Skills): 97.4 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM2014 Logic 2026-07: 71.88 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM2014 Logic 2026-08: 64.74 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on React Native Evals: 88.11 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Terminal-Bench 2.1: 51.8 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Terminal-Bench 2.1 (Claude Code): 51.8 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Appwrite Arena (With Skills): 96.9 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Appwrite Arena (Without Skills): 95.5 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Mystery Game Puzzles: 33.0 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Terminal-Bench 2.1: 37.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Appwrite Arena (With Skills): 96.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Appwrite Arena (Without Skills): 93.6 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Featherbench: 93.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Featherbench - Rubric Quality: 8.8 (#8)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SWE-Milestone&lt;/strong&gt;: GLM-5.3 (58.75) beat Claude Opus 4.8 (Max, 1M) by 6.91&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Featherbench&lt;/strong&gt;: GLM-5.3 (100.0) beat Gemini 3.6 Flash by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Appwrite Arena (With Skills)&lt;/strong&gt;: Muse Spark 1.2 (97.8) beat GPT-5.5 by 0.1&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Weekly&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (16)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;WorkSurface-Bench&lt;/strong&gt; (Aggregate Score (0-1)): leader Gemini 3.1 Pro (Preview) (0.7649), 4 models&lt;br&gt;&lt;span&gt;Enterprise-agent benchmark that splits a workspace into three knowledge surfaces — retrievable documents, structured tables and a dependency graph — and asks whether an agent routes each of 1,151 atomic questions to the right one, acquires the evidence and answers correctly. The published score is the all-tools ReAct setting, where every surface is exposed and the model has to choose; the aggregate weights answer 0.35, evidence 0.30, routing 0.25 and efficiency 0.10.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Pre-Flight&lt;/strong&gt; (Accuracy (%)): leader GPT-5.5 (82.7), 42 models&lt;br&gt;&lt;span&gt;Aviation operational knowledge: regulations, procedures and the documentation airline operations actually run on. Built because general benchmarks say nothing about whether a model reasons safely inside a domain where being confidently wrong grounds aircraft.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PredAct-Bench&lt;/strong&gt; (Overall (%)): leader Gemini 3 Flash (63.4), 12 models&lt;br&gt;&lt;span&gt;Tool-augmented dialogue where the tools lie. Most task-oriented benchmarks assume perfect tool output; this one injects controlled noise and scores whether the model still reaches the right multi-step decision in education, health and finance settings.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SaliTrap&lt;/strong&gt; (Overall (%)): leader Claude Opus 4.7 (62.5), 12 models&lt;br&gt;&lt;span&gt;Salience bias in everyday commonsense: models have learned to weight explicit stated conditions so heavily that an obvious unstated one gets ignored. The traps are ordinary situations where a human would never need the condition spelled out.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ContractScrub&lt;/strong&gt; (F1 (0-1)): leader Gemini 3.1 Pro (Preview) (0.66), 10 models&lt;br&gt;&lt;span&gt;Contract scrubbing: the final review pass over a transactional agreement, hunting errors and internal inconsistencies. Scored by F1 because both missing a real defect and inventing one are failures a lawyer would notice.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EpiBench&lt;/strong&gt; (Accuracy (%)): leader Grok 4.20 (33.6), 9 models&lt;br&gt;&lt;span&gt;Epitope understanding for antibody drug discovery: where an antibody binds an antigen, which determines functional blockade and escape resistance downstream. Scores sit in the twenties and thirties, so this is a long way from saturated.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CARE-Bench&lt;/strong&gt; (Overall (%)): leader Llama 4 Scout (50.4), 10 models&lt;br&gt;&lt;span&gt;Patient-facing triage: given a symptom question asked before any clinician contact, what should the user do next. Source-grounded and sequential, because the safety-relevant output is the recommended action rather than the explanation.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OrchBench&lt;/strong&gt; (Score (0-1)): leader GPT-5.5 (0.81), 9 models&lt;br&gt;&lt;span&gt;Multi-agent orchestration plans judged in isolation through deterministic simulation, so plan quality is separated from the worker models that would execute it. End-to-end evaluation conflates the two and cannot say which one failed.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Patient-Context Ambiguity&lt;/strong&gt; (Accuracy (%)): leader Claude Opus 4.8 (91.8), 5 models&lt;br&gt;&lt;span&gt;Short underspecified health queries that are linguistically clear but support several plausible answers depending on patient context. Scores whether the model resolves the ambiguity rather than confidently picking one reading.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Skill Coverage&lt;/strong&gt; (Task Success Rate (%)): leader GPT-5.5 (53.26), 5 models&lt;br&gt;&lt;span&gt;Task success as a function of which skills an agent has available, built to test whether more skills actually help. The paper&amp;#x27;s answer is that they often do not.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ORCA-bench&lt;/strong&gt; (Root-Cause Accuracy (%)): leader Claude Sonnet 4.6 (30.9), 5 models&lt;br&gt;&lt;span&gt;Root-cause analysis of incidents: given the symptoms and the telemetry, name what actually broke. Accuracy sits between 15 and 31 percent, so the gap to a competent on-call engineer is still wide.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenUI Generative UI Benchmark&lt;/strong&gt; (Structural Validity (%)): leader Grok 4.6 (99.5), 30 models&lt;br&gt;&lt;span&gt;OpenUI Generative UI Benchmark (Thesys) — generated user interfaces scored by the shipped OpenUI parser: a screen counts as valid only if it parses, has a root, resolves every reference, invents no components, uses valid props and is not truncated. Four generations per brief across 46 briefs; headline is structural validity percent.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - BioSecBench-Function&lt;/strong&gt; (Pass Rate (%)): leader Claude Opus 5 (50.3), 11 models&lt;br&gt;&lt;span&gt;BioSecBench-Function (benchmarks.bio) — genomic function prediction under biosecurity framing: agentic tasks that ask a model to reason from sequence to function across 111 evaluations, scored as pass rate over gradeable trials with refusals reported separately.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (CoWorkBench)&lt;/strong&gt; (Score (%)): leader Qwen 3.8 Max (74.8), 5 models&lt;br&gt;&lt;span&gt;LLM Stats mirror of CoWorkBench, Qwen&amp;#x27;s cowork benchmark for long-horizon office and productivity tasks; the published roster is small and Qwen-heavy.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (GDPval-AA)&lt;/strong&gt; (ELO): leader GLM-5.3 Flash (1773.0), 5 models&lt;br&gt;&lt;span&gt;GDP validation benchmark testing economic data retrieval and reasoning, measuring accuracy on GDP-related factual questions.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Job Bench)&lt;/strong&gt; (Score (%)): leader Qwen3.8-Flash-Next (55.7), 5 models&lt;br&gt;&lt;span&gt;LLM Stats mirror of Job Bench, scoring AI agents on realistic professional tasks that require multi-step planning.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (201)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; — ELO 1791, #1&lt;ul&gt;&lt;li&gt;React Native Evals: 88.11 (#1/25)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Knowledge: 94.1 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Reasoning: 68.4 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Math: 77.3 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Social Science: 94.6 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Science: 97.5 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass Reasoning - Academic: 56.7 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass Math - Competition: 74.7 (#1/15)&lt;/li&gt;&lt;li&gt;Terminal-Bench 2.1: 51.8 (#1/10)&lt;/li&gt;&lt;li&gt;Terminal-Bench 2.1 (Claude Code): 51.8 (#1/5)&lt;/li&gt;&lt;li&gt;...and 26 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; — ELO 1782, #3&lt;ul&gt;&lt;li&gt;OpenCompass Knowledge - Engineering: 95.8 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Common Sense: 92.9 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass Math - College: 85.6 (#1/15)&lt;/li&gt;&lt;li&gt;HieroglyphBench: 55.0 (#1/23)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Knowledge: 94.0 (#2/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Math: 76.8 (#2/15)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Geometry: 90.77 (#2/76)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Humanities: 94.2 (#3/15)&lt;/li&gt;&lt;li&gt;BoundaryBench (Unrestricted): 79.8 (#3/14)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths: 89.45 (#3/76)&lt;/li&gt;&lt;li&gt;...and 27 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; — ELO 1777, #4&lt;ul&gt;&lt;li&gt;PostTrainBench: 41.79 (#1/12)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Number and Operations: 86.49 (#2/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Statistics and Probability: 71.43 (#3/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths: 86.92 (#4/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Geometry: 83.85 (#5/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Measurement: 97.3 (#5/76)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 85.0 (#5/132)&lt;/li&gt;&lt;li&gt;MCP Atlas: 83.3 (#9/51)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Algebra: 92.31 (#16/76)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; — ELO 1776, #5&lt;ul&gt;&lt;li&gt;Chatbot Arena (Search): 1257.0 (#1/34)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths: 91.14 (#1/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Geometry: 90.77 (#1/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Number and Operations: 89.19 (#1/76)&lt;/li&gt;&lt;li&gt;WildClawBench: 67.2 (#1/66)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Code: 96.3 (#2/15)&lt;/li&gt;&lt;li&gt;OpenCompass Reasoning - Academic: 55.8 (#2/15)&lt;/li&gt;&lt;li&gt;OpenCompass Code - Comprehensive: 96.3 (#2/15)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Algebra: 96.15 (#2/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Measurement: 97.3 (#2/76)&lt;/li&gt;&lt;li&gt;...and 20 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; — ELO 1756, #7&lt;ul&gt;&lt;li&gt;AA-LCR: 82.6667 (#2/210)&lt;/li&gt;&lt;li&gt;NatureBench: 14.44 (#4/16)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Social Science: 90.4 (#5/15)&lt;/li&gt;&lt;li&gt;OpenCompass Math - Competition: 68.9 (#5/15)&lt;/li&gt;&lt;li&gt;CAIS Vision Capabilities Index: 63.2 (#5/38)&lt;/li&gt;&lt;li&gt;PostTrainBench: 31.96 (#6/12)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Math: 74.1 (#6/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Science: 92.5 (#6/15)&lt;/li&gt;&lt;li&gt;OpenCompass Reasoning - Academic: 51.7 (#6/15)&lt;/li&gt;&lt;li&gt;Appwrite Arena (Without Skills): 95.0 (#6/24)&lt;/li&gt;&lt;li&gt;...and 18 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.6&lt;/strong&gt; — ELO 1754, #8&lt;ul&gt;&lt;li&gt;Benchmarks.bio - BioSecBench-Refusal: 64.2 (#1/18)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Humanities: 95.8 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Social Science: 92.5 (#2/15)&lt;/li&gt;&lt;li&gt;OpenCompass Math - College: 83.8 (#2/15)&lt;/li&gt;&lt;li&gt;Appwrite Arena (With Skills): 97.8 (#2/24)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Knowledge: 93.8 (#3/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Science: 95.8 (#3/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Engineering: 94.2 (#4/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Common Sense: 90.8 (#5/15)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 13.17 (#6/54)&lt;/li&gt;&lt;li&gt;...and 25 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.2&lt;/strong&gt; — ELO 1754, #9&lt;ul&gt;&lt;li&gt;Appwrite Arena (With Skills): 97.8 (#1/24)&lt;/li&gt;&lt;li&gt;AA-LCR: 83.3333 (#1/210)&lt;/li&gt;&lt;li&gt;EQ-Bench Longform Writing: 81.5 (#6/130)&lt;/li&gt;&lt;li&gt;Appwrite Arena (Without Skills): 94.8 (#7/24)&lt;/li&gt;&lt;li&gt;SimpleQA Verified: 60.3 (#9/66)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 43.0 (#13/24)&lt;/li&gt;&lt;li&gt;CritPt: 17.7 (#21/284)&lt;/li&gt;&lt;li&gt;DuelLab Overall: 52.8 (#23/121)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 120.0 (#23/130)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1533.68 (#27/116)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; — ELO 1750, #10&lt;ul&gt;&lt;li&gt;OpenCompass Math - Competition: 70.8 (#2/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Code: 95.5 (#3/15)&lt;/li&gt;&lt;li&gt;OpenCompass Code - Comprehensive: 95.5 (#3/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Reasoning: 65.2 (#4/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Math: 75.0 (#4/15)&lt;/li&gt;&lt;li&gt;OpenCompass Reasoning - Common: 78.1 (#4/15)&lt;/li&gt;&lt;li&gt;OpenCompass Reasoning - Academic: 52.3 (#4/15)&lt;/li&gt;&lt;li&gt;NatureBench: 11.11 (#6/16)&lt;/li&gt;&lt;li&gt;OpenCompass Math - College: 79.2 (#7/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Social Science: 87.9 (#8/15)&lt;/li&gt;&lt;li&gt;...and 9 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5&lt;/strong&gt; — ELO 1748, #11&lt;ul&gt;&lt;li&gt;OpenCompass LLM - Code: 96.5 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass Code - Comprehensive: 96.5 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Reasoning: 66.9 (#2/15)&lt;/li&gt;&lt;li&gt;OpenCompass Reasoning - Common: 78.6 (#3/15)&lt;/li&gt;&lt;li&gt;OpenCompass Reasoning - Academic: 55.2 (#3/15)&lt;/li&gt;&lt;li&gt;GeneBench: 25.0 (#3/16)&lt;/li&gt;&lt;li&gt;OpenCompass Math - Competition: 68.9 (#4/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Social Science: 90.0 (#6/15)&lt;/li&gt;&lt;li&gt;SWE Atlas: 45.43 (#6/29)&lt;/li&gt;&lt;li&gt;SimpleQA Verified: 63.0 (#8/66)&lt;/li&gt;&lt;li&gt;...and 13 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.6 Flash&lt;/strong&gt; — ELO 1747, #13&lt;ul&gt;&lt;li&gt;AI for Education Visual Maths - Measurement: 97.3 (#1/76)&lt;/li&gt;&lt;li&gt;Crosby micro1 RedlineBench: 51.0 (#4/11)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Statistics and Probability: 71.43 (#6/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Number and Operations: 70.27 (#10/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths: 78.48 (#12/76)&lt;/li&gt;&lt;li&gt;AA-LCR: 79.0 (#12/210)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Geometry: 73.85 (#15/76)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 123.0 (#20/130)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Algebra: 88.46 (#23/76)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen3.8-Flash-Next&lt;/strong&gt; — ELO 1747, #14&lt;ul&gt;&lt;li&gt;LLM Stats (RealWorldQA): 88.5 (#1/30)&lt;/li&gt;&lt;li&gt;RealWorldQA: 88.5 (#1/48)&lt;/li&gt;&lt;li&gt;LLM Stats (AndroidWorld): 84.5 (#2/6)&lt;/li&gt;&lt;li&gt;LLM Stats (ERQA): 72.3 (#2/25)&lt;/li&gt;&lt;li&gt;LLM Stats (MathVision): 95.7 (#2/34)&lt;/li&gt;&lt;li&gt;LLM Stats (Agents' Last Exam): 51.2 (#3/13)&lt;/li&gt;&lt;li&gt;LLM Stats (CharXiv-R): 90.6 (#4/53)&lt;/li&gt;&lt;li&gt;LLM Stats (Toolathlon): 73.5 (#4/39)&lt;/li&gt;&lt;li&gt;LLM Stats (LVBench): 76.6 (#5/26)&lt;/li&gt;&lt;li&gt;LVBench: 76.6 (#5/40)&lt;/li&gt;&lt;li&gt;...and 26 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Pro (Preview)&lt;/strong&gt; — ELO 1737, #15&lt;ul&gt;&lt;li&gt;SimpleQA Verified: 73.5 (#1/66)&lt;/li&gt;&lt;li&gt;Epoch AI - Enigma Eval: 36.78 (#3/46)&lt;/li&gt;&lt;li&gt;DeepResearchBench: 47.8 (#22/41)&lt;/li&gt;&lt;li&gt;ForecastBench: 64.0 (#115/300)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; — ELO 1736, #16&lt;ul&gt;&lt;li&gt;LLM GPU Kernel Generation: 97.1 (#3/6)&lt;/li&gt;&lt;li&gt;StructureClaw (Automatic Workflow): 89.3 (#4/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Terra&lt;/strong&gt; — ELO 1732, #17&lt;ul&gt;&lt;li&gt;Crosby micro1 RedlineBench: 49.3 (#6/11)&lt;/li&gt;&lt;li&gt;Appwrite Arena (Without Skills): 93.5 (#11/24)&lt;/li&gt;&lt;li&gt;AA-Briefcase: 34.14 (#15/26)&lt;/li&gt;&lt;li&gt;Appwrite Arena (With Skills): 95.2 (#19/24)&lt;/li&gt;&lt;li&gt;APEX-Agents-AA: 0.39 (#31/56)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 19.0 (#47/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; — ELO 1732, #18&lt;ul&gt;&lt;li&gt;SWE-Milestone: 58.75 (#1/27)&lt;/li&gt;&lt;li&gt;Humanity's Last Exam (Self-Reported, With Tools): 62.5 (#1/27)&lt;/li&gt;&lt;li&gt;Featherbench: 100.0 (#1/17)&lt;/li&gt;&lt;li&gt;SecIT Bench (Pydantic AI): 81.44 (#1/16)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Hard: 63.19 (#2/9)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Engineering: 95.4 (#2/15)&lt;/li&gt;&lt;li&gt;ProphetArena: 0.9541 (#3/20)&lt;/li&gt;&lt;li&gt;Terminal-Bench 2.1: 41.8 (#3/10)&lt;/li&gt;&lt;li&gt;Terminal-Bench 2.1 (Claude Code): 41.8 (#3/5)&lt;/li&gt;&lt;li&gt;Featherbench - Rubric Quality: 9.3 (#3/17)&lt;/li&gt;&lt;li&gt;...and 42 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; — ELO 1729, #19&lt;ul&gt;&lt;li&gt;OpenCompass Reasoning - Common: 80.6 (#1/15)&lt;/li&gt;&lt;li&gt;PostTrainBench: 33.84 (#4/12)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-05: 68.32 (#5/43)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-06: 68.32 (#5/43)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Reasoning: 64.1 (#6/15)&lt;/li&gt;&lt;li&gt;OpenCompass Math - Competition: 68.3 (#8/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Math: 71.5 (#9/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Humanities: 90.4 (#10/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Social Science: 87.5 (#10/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Science: 89.6 (#10/15)&lt;/li&gt;&lt;li&gt;...and 15 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash&lt;/strong&gt; — ELO 1729, #20&lt;ul&gt;&lt;li&gt;AA-LCR: 81.0 (#5/210)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Measurement: 94.59 (#8/76)&lt;/li&gt;&lt;li&gt;MCP Atlas: 83.6 (#8/51)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Number and Operations: 70.27 (#11/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Geometry: 74.62 (#14/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths: 75.95 (#17/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Statistics and Probability: 42.86 (#18/76)&lt;/li&gt;&lt;li&gt;CritPt: 10.9 (#35/284)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Algebra: 73.08 (#40/76)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro (0813)&lt;/strong&gt; — ELO 1728, #21&lt;ul&gt;&lt;li&gt;AA-Briefcase: 43.52 (#9/26)&lt;/li&gt;&lt;li&gt;CritPt: 18.0 (#19/284)&lt;/li&gt;&lt;li&gt;AA-LCR: 75.3333 (#36/210)&lt;/li&gt;&lt;li&gt;Bullshit Benchmark: 32.7 (#65/188)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 155.18 (#93/507)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 40.0 (#228/403)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.5&lt;/strong&gt; — ELO 1726, #22&lt;ul&gt;&lt;li&gt;Chatbot Arena (Search): 1213.0 (#8/34)&lt;/li&gt;&lt;li&gt;PostTrainBench: 23.45 (#10/12)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Geometry: 75.38 (#12/76)&lt;/li&gt;&lt;li&gt;FrontierCode: 56.6 (#13/47)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths: 77.64 (#14/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Measurement: 94.59 (#14/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Statistics and Probability: 42.86 (#17/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Algebra: 92.31 (#19/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Number and Operations: 64.86 (#20/76)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.1 Pro&lt;/strong&gt; — ELO 1726, #23&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2026-06: 60.15 (#8/43)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-07: 49.35 (#13/45)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-08: 45.78 (#18/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3 Flash&lt;/strong&gt; — ELO 1725, #24&lt;ul&gt;&lt;li&gt;LLM Stats (AutomationBench): 48.8 (#1/14)&lt;/li&gt;&lt;li&gt;LLM Stats (MVBench): 77.8 (#1/18)&lt;/li&gt;&lt;li&gt;LLM Stats (Toolathlon): 78.4 (#1/39)&lt;/li&gt;&lt;li&gt;LLM Stats (Artificial Analysis): 57.0 (#2/8)&lt;/li&gt;&lt;li&gt;Toolathlon: 78.4 (#2/41)&lt;/li&gt;&lt;li&gt;AA GDPval: 1764.66 (#3/219)&lt;/li&gt;&lt;li&gt;Humanity's Last Exam (Self-Reported, With Tools): 55.3 (#3/27)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Mega: 13.64 (#4/5)&lt;/li&gt;&lt;li&gt;LLM Stats (NL2Repo): 56.3 (#4/20)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Code): 1634.0 (#5/121)&lt;/li&gt;&lt;li&gt;...and 58 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Pro&lt;/strong&gt; — ELO 1720, #25&lt;ul&gt;&lt;li&gt;Arena AI Code: 1437.8 (#50/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Pro (Preview)&lt;/strong&gt; — ELO 1716, #27&lt;ul&gt;&lt;li&gt;DeepResearchBench: 46.3 (#28/41)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 153.06 (#134/507)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen3.8 2.4T A95B&lt;/strong&gt; — ELO 1714, #28&lt;ul&gt;&lt;li&gt;AI for Education SEND: 86.24 (#12/235)&lt;/li&gt;&lt;li&gt;CritPt: 20.0 (#16/284)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Maths: 91.27 (#17/243)&lt;/li&gt;&lt;li&gt;OpenRouter Tau2-Bench Airline: 76.7 (#19/118)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 119.0 (#26/130)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy: 87.99 (#33/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Science: 91.8 (#33/243)&lt;/li&gt;&lt;li&gt;OpenRouter GPQA Diamond: 84.3 (#34/119)&lt;/li&gt;&lt;li&gt;AA-LCR: 75.3333 (#34/210)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Primary: 92.02 (#36/243)&lt;/li&gt;&lt;li&gt;...and 3 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.7&lt;/strong&gt; — ELO 1712, #29&lt;ul&gt;&lt;li&gt;PostTrainBench: 28.56 (#8/12)&lt;/li&gt;&lt;li&gt;MCP Atlas: 79.1 (#19/51)&lt;/li&gt;&lt;li&gt;CritPt: 5.1 (#61/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4&lt;/strong&gt; — ELO 1709, #30&lt;ul&gt;&lt;li&gt;SWE Atlas: 40.8 (#11/29)&lt;/li&gt;&lt;li&gt;PostTrainBench: 19.0 (#12/12)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 75.0 (#25/132)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 28.0 (#26/110)&lt;/li&gt;&lt;li&gt;APEX-Agents-AA: 0.33 (#35/56)&lt;/li&gt;&lt;li&gt;CyberGym: 79.0 (#36/54)&lt;/li&gt;&lt;li&gt;CritPt: 7.4 (#48/284)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1390.56 (#69/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Luna&lt;/strong&gt; — ELO 1708, #31&lt;ul&gt;&lt;li&gt;Crosby micro1 RedlineBench: 55.5 (#3/11)&lt;/li&gt;&lt;li&gt;Appwrite Arena (Without Skills): 92.9 (#12/24)&lt;/li&gt;&lt;li&gt;AA-Briefcase: 37.98 (#13/26)&lt;/li&gt;&lt;li&gt;CritPt: 20.6 (#15/284)&lt;/li&gt;&lt;li&gt;Appwrite Arena (With Skills): 95.2 (#18/24)&lt;/li&gt;&lt;li&gt;Guesswork 2026-08: 1.0249 (#22/33)&lt;/li&gt;&lt;li&gt;APEX-Agents-AA: 0.36 (#33/56)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 41.4 (#44/92)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 17.0 (#56/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.3 Codex&lt;/strong&gt; — ELO 1706, #32&lt;ul&gt;&lt;li&gt;Arena AI Code: 1408.38 (#59/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 5&lt;/strong&gt; — ELO 1705, #33&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2026-07: 43.14 (#16/45)&lt;/li&gt;&lt;li&gt;DuelLab Overall: 54.3 (#19/121)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-08: 39.57 (#21/46)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 155.87 (#92/507)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2 Codex&lt;/strong&gt; — ELO 1705, #34&lt;ul&gt;&lt;li&gt;Arena AI Code: 1338.28 (#87/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 27B&lt;/strong&gt; — ELO 1704, #35&lt;ul&gt;&lt;li&gt;WebDev Arena: 1594.78 (#9/116)&lt;/li&gt;&lt;li&gt;Agents on Rails: 76.2 (#10/16)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1594.78 (#10/30)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 8.05 (#11/54)&lt;/li&gt;&lt;li&gt;LVBench: 72.4 (#12/40)&lt;/li&gt;&lt;li&gt;Bullshit Benchmark: 76.4 (#13/188)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Science: 93.44 (#13/243)&lt;/li&gt;&lt;li&gt;Toolathlon: 67.1 (#15/41)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 16.0 (#21/24)&lt;/li&gt;&lt;li&gt;AA-LCR: 77.3333 (#23/210)&lt;/li&gt;&lt;li&gt;...and 32 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.7 Code&lt;/strong&gt; — ELO 1703, #36&lt;ul&gt;&lt;li&gt;WildClawBench: 46.9 (#26/66)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.6&lt;/strong&gt; — ELO 1702, #38&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2026-02: 78.02 (#1/46)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 50.3 (#1/35)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-03: 77.23 (#2/42)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-04: 77.23 (#3/42)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-05: 76.48 (#3/43)&lt;/li&gt;&lt;li&gt;DeepResearchBench: 51.4 (#8/41)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-06: 40.16 (#17/43)&lt;/li&gt;&lt;li&gt;LVBench: 63.0 (#18/40)&lt;/li&gt;&lt;li&gt;RealWorldQA: 73.9 (#20/48)&lt;/li&gt;&lt;li&gt;CritPt: 2.8 (#85/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Flash&lt;/strong&gt; — ELO 1702, #39&lt;ul&gt;&lt;li&gt;DeepResearchBench: 49.0 (#15/41)&lt;/li&gt;&lt;li&gt;OmniDocBench 1.5: 90.37 (#20/73)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1437.85 (#49/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.1 Turbo&lt;/strong&gt; — ELO 1702, #41&lt;ul&gt;&lt;li&gt;WildClawBench: 62.8 (#3/66)&lt;/li&gt;&lt;li&gt;MCP Atlas: 80.3 (#15/51)&lt;/li&gt;&lt;li&gt;Toolathlon: 49.1 (#36/41)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Flash (Preview)&lt;/strong&gt; — ELO 1701, #42&lt;ul&gt;&lt;li&gt;SimpleQA Verified: 66.8 (#5/66)&lt;/li&gt;&lt;li&gt;DeepResearchBench: 49.8 (#11/41)&lt;/li&gt;&lt;li&gt;CritPt: 1.4 (#106/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.2&lt;/strong&gt; — ELO 1697, #44&lt;ul&gt;&lt;li&gt;SWE Atlas: 48.12 (#4/29)&lt;/li&gt;&lt;li&gt;PostTrainBench: 31.7 (#7/12)&lt;/li&gt;&lt;li&gt;MCP Atlas: 77.8 (#21/51)&lt;/li&gt;&lt;li&gt;CritPt: 16.7 (#25/284)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 54.74 (#33/92)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 15.0 (#67/110)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 14.0 (#106/182)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 75.56 (#113/256)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Plus&lt;/strong&gt; — ELO 1697, #45&lt;ul&gt;&lt;li&gt;RealWorldQA: 86.9 (#2/48)&lt;/li&gt;&lt;li&gt;IMO-AnswerBench: 86.0 (#7/15)&lt;/li&gt;&lt;li&gt;Toolathlon: 50.6 (#29/41)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 34.39 (#49/92)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 17.0 (#53/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hy3&lt;/strong&gt; — ELO 1694, #46&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2026-07: 44.6 (#14/45)&lt;/li&gt;&lt;li&gt;NL2Repo: 45.6 (#15/37)&lt;/li&gt;&lt;li&gt;MCP Atlas: 79.1 (#18/51)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-08: 39.51 (#22/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.5&lt;/strong&gt; — ELO 1693, #47&lt;ul&gt;&lt;li&gt;LLM2014 Code 2025-11 - C#: 9.92 (#2/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - C++: 9.92 (#2/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - Golang: 9.1 (#2/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - Python: 9.33 (#2/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11: 90.75 (#3/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - Java: 8.58 (#4/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - TypeScript: 7.6 (#6/26)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-11: 37.68 (#27/53)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-01: 33.08 (#29/45)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-12: 33.08 (#33/51)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash (0731)&lt;/strong&gt; — ELO 1693, #48&lt;ul&gt;&lt;li&gt;Toolathlon: 70.3 (#14/41)&lt;/li&gt;&lt;li&gt;Vals AI ProgramBench: 57.29 (#20/42)&lt;/li&gt;&lt;li&gt;Design Arena (SVG): 1219.0 (#40/112)&lt;/li&gt;&lt;li&gt;AA-LCR: 74.3333 (#43/210)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 154.35 (#117/507)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 40.0 (#238/403)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5&lt;/strong&gt; — ELO 1690, #50&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 44.1 (#8/35)&lt;/li&gt;&lt;li&gt;RealWorldQA: 82.75 (#8/48)&lt;/li&gt;&lt;li&gt;CyberGym: 60.2 (#26/54)&lt;/li&gt;&lt;li&gt;HMMT 2025: 88.33 (#27/67)&lt;/li&gt;&lt;li&gt;AA-LCR: 76.3333 (#31/210)&lt;/li&gt;&lt;li&gt;NL2Repo: 21.7 (#34/37)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 37.19 (#46/92)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1419.14 (#57/113)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 16.0 (#60/110)&lt;/li&gt;&lt;li&gt;CritPt: 1.1 (#118/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.5 (20251101)&lt;/strong&gt; — ELO 1690, #51&lt;ul&gt;&lt;li&gt;DeepResearchBench: 54.8 (#3/41)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2&lt;/strong&gt; — ELO 1688, #53&lt;ul&gt;&lt;li&gt;HMMT 2025: 100.0 (#1/67)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 22.0 (#39/110)&lt;/li&gt;&lt;li&gt;CritPt: 7.9 (#47/284)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1417.81 (#58/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro&lt;/strong&gt; — ELO 1687, #54&lt;ul&gt;&lt;li&gt;Featherbench: 96.0 (#2/17)&lt;/li&gt;&lt;li&gt;IMO-AnswerBench: 89.8 (#5/15)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 45.6 (#6/35)&lt;/li&gt;&lt;li&gt;MathArena Apex: 38.3 (#8/48)&lt;/li&gt;&lt;li&gt;Featherbench - Rubric Quality: 8.7 (#11/17)&lt;/li&gt;&lt;li&gt;SWE Atlas: 27.15 (#23/29)&lt;/li&gt;&lt;li&gt;CritPt: 12.9 (#30/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.6&lt;/strong&gt; — ELO 1686, #55&lt;ul&gt;&lt;li&gt;IMO-AnswerBench: 91.1 (#1/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Math: 75.7 (#3/15)&lt;/li&gt;&lt;li&gt;OpenCompass Math - College: 82.7 (#3/15)&lt;/li&gt;&lt;li&gt;OpenCompass Reasoning - Common: 78.1 (#5/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Humanities: 92.5 (#6/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Engineering: 90.8 (#7/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Common Sense: 89.6 (#7/15)&lt;/li&gt;&lt;li&gt;OpenCompass Math - Competition: 68.6 (#7/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Knowledge: 89.8 (#8/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Reasoning: 62.9 (#8/15)&lt;/li&gt;&lt;li&gt;...and 8 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; — ELO 1685, #56&lt;ul&gt;&lt;li&gt;MCP Atlas: 76.0 (#25/51)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1407.6 (#60/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.1&lt;/strong&gt; — ELO 1683, #57&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 42.0 (#11/35)&lt;/li&gt;&lt;li&gt;CritPt: 4.6 (#64/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.0 Pro&lt;/strong&gt; — ELO 1683, #59&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2026-02: 69.55 (#4/46)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-03: 68.36 (#4/42)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-04: 66.02 (#6/42)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-05: 57.4 (#8/43)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-06: 55.84 (#10/43)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 42.8 (#10/35)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.6&lt;/strong&gt; — ELO 1678, #61&lt;ul&gt;&lt;li&gt;DeepResearchBench: 50.4 (#9/41)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 78.5 (#19/132)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-02: 30.17 (#28/46)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-03: 29.38 (#29/42)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-04: 26.52 (#33/42)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-05: 19.89 (#34/43)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-06: 16.77 (#34/43)&lt;/li&gt;&lt;li&gt;SimpleQA Verified: 35.5 (#37/66)&lt;/li&gt;&lt;li&gt;CritPt: 0.9 (#136/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 Plus&lt;/strong&gt; — ELO 1678, #62&lt;ul&gt;&lt;li&gt;AI for Education Visual Maths - Geometry: 80.77 (#7/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Algebra: 96.15 (#8/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths: 80.59 (#9/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Measurement: 94.59 (#13/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Statistics and Probability: 42.86 (#16/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Number and Operations: 62.16 (#24/76)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 32.28 (#54/92)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 397B A17B&lt;/strong&gt; — ELO 1678, #63&lt;ul&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 18.0 (#50/110)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 29.47 (#56/92)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1399.23 (#64/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.9 (#128/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3&lt;/strong&gt; — ELO 1676, #64&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2025-04: 85.85 (#1/29)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-05: 85.14 (#1/32)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-06: 83.95 (#1/38)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-08: 71.31 (#4/45)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 33.33 (#52/92)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 23.0 (#119/132)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5-Pro&lt;/strong&gt; — ELO 1676, #65&lt;ul&gt;&lt;li&gt;CritPt: 1.1 (#115/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Codex&lt;/strong&gt; — ELO 1676, #66&lt;ul&gt;&lt;li&gt;Arena AI Code: 1336.28 (#88/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.3&lt;/strong&gt; — ELO 1674, #67&lt;ul&gt;&lt;li&gt;SWE Atlas: 32.6 (#19/29)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.20 0309&lt;/strong&gt; — ELO 1673, #69&lt;ul&gt;&lt;li&gt;ForecastBench: 64.1 (#110/300)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash&lt;/strong&gt; — ELO 1670, #70&lt;ul&gt;&lt;li&gt;WebDev Arena: 1431.07 (#63/116)&lt;/li&gt;&lt;li&gt;CritPt: 3.4 (#74/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash Lite&lt;/strong&gt; — ELO 1670, #71&lt;ul&gt;&lt;li&gt;AA-LCR: 74.6667 (#41/210)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 108.0 (#61/130)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#283/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1&lt;/strong&gt; — ELO 1669, #72&lt;ul&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 19.0 (#48/110)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1391.01 (#68/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#212/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M3&lt;/strong&gt; — ELO 1668, #73&lt;ul&gt;&lt;li&gt;OpenCompass Knowledge - Science: 90.8 (#8/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Engineering: 88.3 (#9/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Knowledge: 86.6 (#13/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Humanities: 87.1 (#14/15)&lt;/li&gt;&lt;li&gt;OpenCompass Knowledge - Common Sense: 84.2 (#14/15)&lt;/li&gt;&lt;li&gt;OpenCompass Reasoning - Common: 69.9 (#14/15)&lt;/li&gt;&lt;li&gt;OpenCompass Reasoning - Academic: 38.1 (#14/15)&lt;/li&gt;&lt;li&gt;OpenCompass Math - College: 74.3 (#14/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Reasoning: 54.0 (#15/15)&lt;/li&gt;&lt;li&gt;OpenCompass LLM - Math: 63.0 (#15/15)&lt;/li&gt;&lt;li&gt;...and 5 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 (2025-04-16)&lt;/strong&gt; — ELO 1668, #74&lt;ul&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 29.0 (#23/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling Small&lt;/strong&gt; — ELO 1667, #75&lt;ul&gt;&lt;li&gt;Arena AI Code: 1401.56 (#62/113)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 106.0 (#63/130)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1401.56 (#68/116)&lt;/li&gt;&lt;li&gt;AA-LCR: 69.3333 (#89/210)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Glimmer 30B&lt;/strong&gt; — ELO 1667, #76&lt;ul&gt;&lt;li&gt;AA-LCR: 80.0 (#7/210)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1359.0 (#79/113)&lt;/li&gt;&lt;li&gt;CritPt: 2.6 (#89/284)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 92.0 (#111/130)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.5&lt;/strong&gt; — ELO 1665, #77&lt;ul&gt;&lt;li&gt;LLM2014 Code 2025-11 - Java: 9.22 (#2/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - TypeScript: 8.92 (#3/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11: 81.67 (#4/26)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-10: 69.78 (#4/50)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - Golang: 7.85 (#5/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - Python: 8.88 (#5/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - C++: 7.17 (#6/26)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-11: 66.7 (#6/53)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - C#: 7.72 (#7/26)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-01: 60.83 (#9/45)&lt;/li&gt;&lt;li&gt;...and 11 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Mini&lt;/strong&gt; — ELO 1665, #78&lt;ul&gt;&lt;li&gt;FrontierCode: 43.01 (#31/47)&lt;/li&gt;&lt;li&gt;APEX-Agents-AA: 0.28 (#38/56)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 24.56 (#60/92)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1397.08 (#66/113)&lt;/li&gt;&lt;li&gt;CritPt: 2.9 (#83/284)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 11.0 (#84/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.3&lt;/strong&gt; — ELO 1665, #79&lt;ul&gt;&lt;li&gt;AI for Education Visual Maths - Geometry: 45.38 (#42/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Measurement: 75.68 (#42/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths: 49.79 (#45/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Algebra: 57.69 (#49/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Number and Operations: 40.54 (#53/76)&lt;/li&gt;&lt;li&gt;CritPt: 4.9 (#62/284)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Statistics and Probability: 14.29 (#65/76)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1356.73 (#82/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro&lt;/strong&gt; — ELO 1664, #80&lt;ul&gt;&lt;li&gt;LLM2014 Code 2025-11 - Golang: 8.87 (#3/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11: 74.36 (#6/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - C#: 7.77 (#6/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - C++: 7.15 (#8/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - Python: 7.9 (#8/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - Java: 6.35 (#12/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - TypeScript: 6.58 (#16/26)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 33.1 (#24/35)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1225.69 (#106/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.5&lt;/strong&gt; — ELO 1664, #81&lt;ul&gt;&lt;li&gt;HMMT 2025: 93.33 (#16/67)&lt;/li&gt;&lt;li&gt;CyberGym: 41.3 (#20/54)&lt;/li&gt;&lt;li&gt;SimpleQA Verified: 34.3 (#39/66)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 63.3 (#44/132)&lt;/li&gt;&lt;li&gt;APEX-Agents-AA: 0.12 (#51/56)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1435.92 (#52/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.6 (#150/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.20 Beta (0309)&lt;/strong&gt; — ELO 1664, #82&lt;ul&gt;&lt;li&gt;Arena AI Code: 1373.56 (#74/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 27B&lt;/strong&gt; — ELO 1661, #86&lt;ul&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 35.09 (#48/92)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 7.0 (#96/110)&lt;/li&gt;&lt;li&gt;CritPt: 0.9 (#127/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2 Speciale&lt;/strong&gt; — ELO 1660, #87&lt;ul&gt;&lt;li&gt;HMMT 2025: 97.5 (#6/67)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5&lt;/strong&gt; — ELO 1657, #89&lt;ul&gt;&lt;li&gt;Arena AI Code: 1435.46 (#53/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#226/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Pro&lt;/strong&gt; — ELO 1657, #90&lt;ul&gt;&lt;li&gt;Arena AI Code: 1433.51 (#55/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.1 (20250805)&lt;/strong&gt; — ELO 1656, #92&lt;ul&gt;&lt;li&gt;Arena AI Code: 1388.83 (#70/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5V Turbo&lt;/strong&gt; — ELO 1653, #96&lt;ul&gt;&lt;li&gt;Arena AI Code: 1399.83 (#63/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash Lite&lt;/strong&gt; — ELO 1652, #97&lt;ul&gt;&lt;li&gt;DeepResearchBench: 37.3 (#37/41)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 21.4 (#64/92)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash (Preview 05-20)&lt;/strong&gt; — ELO 1647, #99&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2025-05: 55.28 (#9/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Mini&lt;/strong&gt; — ELO 1645, #100&lt;ul&gt;&lt;li&gt;RealWorldQA: 80.26 (#11/48)&lt;/li&gt;&lt;li&gt;HMMT 2025: 89.17 (#25/67)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 18.25 (#72/92)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 10.0 (#87/110)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#216/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4&lt;/strong&gt; — ELO 1645, #101&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2025-05: 60.12 (#8/32)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-06: 53.48 (#11/38)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-08: 43.68 (#18/45)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-09: 40.23 (#19/46)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-10: 40.23 (#22/50)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-11: 36.88 (#29/53)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 122B A10B&lt;/strong&gt; — ELO 1644, #102&lt;ul&gt;&lt;li&gt;Arena AI Code: 1357.68 (#80/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.6 (#145/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash Lite (Preview)&lt;/strong&gt; — ELO 1643, #104&lt;ul&gt;&lt;li&gt;MCP Atlas: 57.1 (#46/51)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1254.07 (#99/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Max&lt;/strong&gt; — ELO 1643, #105&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 28.4 (#29/35)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Step 3.5 Flash&lt;/strong&gt; — ELO 1642, #106&lt;ul&gt;&lt;li&gt;AA-LCR: 48.0 (#183/210)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4&lt;/strong&gt; — ELO 1641, #107&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2025-08: 78.22 (#3/45)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-09: 74.79 (#3/46)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-10: 74.97 (#3/50)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-07: 55.12 (#5/19)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-11: 69.52 (#5/53)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - Java: 6.22 (#6/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09: 37.44 (#8/19)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - C#: 6.8 (#10/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - Python: 5.76 (#11/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - Golang: 4.06 (#13/20)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.7&lt;/strong&gt; — ELO 1641, #108&lt;ul&gt;&lt;li&gt;Arena AI Code: 1434.29 (#54/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#228/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LongCat 2.0&lt;/strong&gt; — ELO 1641, #109&lt;ul&gt;&lt;li&gt;WritingBench: 83.8 (#2/55)&lt;/li&gt;&lt;li&gt;IMO-AnswerBench: 81.8 (#12/15)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 98.0 (#91/130)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5&lt;/strong&gt; — ELO 1640, #110&lt;ul&gt;&lt;li&gt;Arena AI Code: 1437.8 (#51/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hy3-preview&lt;/strong&gt; — ELO 1639, #112&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2026-04: 56.63 (#11/42)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-05: 47.01 (#12/43)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-06: 46.12 (#14/43)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1356.33 (#83/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.3 (#179/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2&lt;/strong&gt; — ELO 1638, #113&lt;ul&gt;&lt;li&gt;NL2Repo: 22.7 (#32/37)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4&lt;/strong&gt; — ELO 1638, #114&lt;ul&gt;&lt;li&gt;LLM2014 Code 2025-07: 66.98 (#1/19)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09: 61.01 (#2/19)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - TypeScript: 8.89 (#2/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - C#: 8.31 (#3/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - Java: 7.13 (#3/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - Golang: 6.11 (#4/20)&lt;/li&gt;&lt;li&gt;LLM2014 Vision 2025-07: 41.21 (#4/16)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-05: 68.22 (#5/32)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - Python: 6.94 (#6/20)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-06: 62.96 (#8/38)&lt;/li&gt;&lt;li&gt;...and 3 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3 Ultra&lt;/strong&gt; — ELO 1637, #116&lt;ul&gt;&lt;li&gt;IMO-AnswerBench: 88.6 (#6/15)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Maths: 88.89 (#39/243)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 20.0 (#44/110)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 80.73 (#58/235)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Secondary: 86.01 (#62/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy: 86.21 (#64/243)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 86.67 (#71/256)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Primary: 88.26 (#78/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Science: 87.43 (#81/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Social studies: 80.91 (#103/243)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 Flash&lt;/strong&gt; — ELO 1637, #117&lt;ul&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 20.0 (#43/110)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 18.25 (#71/92)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1238.12 (#104/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 27B&lt;/strong&gt; — ELO 1636, #118&lt;ul&gt;&lt;li&gt;Roboflow Vision Evals - Visual Understanding: 71.64 (#16/77)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1357.46 (#81/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.3 (#163/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.7&lt;/strong&gt; — ELO 1636, #119&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 34.5 (#22/35)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1398.14 (#65/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4 Fast&lt;/strong&gt; — ELO 1636, #120&lt;ul&gt;&lt;li&gt;Arena AI Code: 1161.87 (#112/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#196/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2&lt;/strong&gt; — ELO 1633, #126&lt;ul&gt;&lt;li&gt;HMMT 2025: 92.5 (#19/67)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1360.31 (#78/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.9 (#135/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.7 Sonnet (20250219)&lt;/strong&gt; — ELO 1633, #127&lt;ul&gt;&lt;li&gt;OSWorld-Verified: 35.8 (#90/132)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O4 Mini (2025-04-16)&lt;/strong&gt; — ELO 1633, #128&lt;ul&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 5.0 (#102/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.1 Fast&lt;/strong&gt; — ELO 1630, #129&lt;ul&gt;&lt;li&gt;Arena AI Code: 1239.97 (#102/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#195/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.5&lt;/strong&gt; — ELO 1630, #130&lt;ul&gt;&lt;li&gt;Arena AI Code: 1383.9 (#73/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 35B A3B&lt;/strong&gt; — ELO 1629, #131&lt;ul&gt;&lt;li&gt;AI for Education Visual Maths - Statistics and Probability: 71.43 (#4/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Algebra: 92.31 (#12/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Number and Operations: 67.57 (#15/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Measurement: 91.89 (#19/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths: 72.15 (#20/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Geometry: 63.85 (#21/76)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 17.54 (#74/92)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2 Exp&lt;/strong&gt; — ELO 1626, #135&lt;ul&gt;&lt;li&gt;Arena AI Code: 1271.77 (#96/113)&lt;/li&gt;&lt;li&gt;CritPt: 1.4 (#110/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O4 Mini&lt;/strong&gt; — ELO 1626, #136&lt;ul&gt;&lt;li&gt;LLM2014 Code 2025-09 - Python: 9.17 (#1/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-07: 66.75 (#2/19)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - C#: 8.65 (#2/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - Golang: 7.35 (#2/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - Java: 7.89 (#2/20)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-04: 80.87 (#2/29)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-05: 80.16 (#2/32)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-06: 78.97 (#2/38)&lt;/li&gt;&lt;li&gt;LLM2014 Vision 2025-07: 53.4 (#2/16)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - C++: 6.04 (#3/20)&lt;/li&gt;&lt;li&gt;...and 4 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.6&lt;/strong&gt; — ELO 1626, #137&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 34.2 (#23/35)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1340.18 (#86/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#231/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 235B A22B 2507&lt;/strong&gt; — ELO 1626, #138&lt;ul&gt;&lt;li&gt;WritingBench: 82.34 (#3/55)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 9.0 (#89/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1&lt;/strong&gt; — ELO 1624, #139&lt;ul&gt;&lt;li&gt;ComplexFuncBench: 47.6 (#9/20)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 14.74 (#78/92)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.1 Terminus&lt;/strong&gt; — ELO 1623, #140&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#266/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash&lt;/strong&gt; — ELO 1621, #143&lt;ul&gt;&lt;li&gt;LLM2014 Code 2025-09 - Java: 6.97 (#4/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - C#: 7.98 (#5/20)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-04: 63.69 (#7/29)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-07: 45.04 (#9/19)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09: 36.34 (#11/19)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - Python: 5.28 (#16/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - Golang: 2.88 (#17/20)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - TypeScript: 5.15 (#17/20)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-05: 42.85 (#17/32)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-09 - C++: 2.43 (#19/20)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1&lt;/strong&gt; — ELO 1620, #145&lt;ul&gt;&lt;li&gt;CyberGym: 7.23 (#8/54)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 5.96 (#85/92)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.1&lt;/strong&gt; — ELO 1620, #146&lt;ul&gt;&lt;li&gt;Arena AI Code: 1386.99 (#71/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1 0528&lt;/strong&gt; — ELO 1618, #150&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 39.6 (#15/35)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 VL 235B A22B Instruct&lt;/strong&gt; — ELO 1618, #151&lt;ul&gt;&lt;li&gt;OmniDocBench 1.5: 89.15 (#28/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4 (20250514)&lt;/strong&gt; — ELO 1618, #152&lt;ul&gt;&lt;li&gt;OSWorld-Verified: 43.9 (#77/132)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 31B&lt;/strong&gt; — ELO 1617, #154&lt;ul&gt;&lt;li&gt;LM Market Cap LMC Score: 80.5 (#71/403)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1363.56 (#76/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#238/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 235B A22B 2507 Instruct&lt;/strong&gt; — ELO 1617, #155&lt;ul&gt;&lt;li&gt;WritingBench: 80.26 (#8/55)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.5&lt;/strong&gt; — ELO 1616, #156&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 30.7 (#27/35)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.1&lt;/strong&gt; — ELO 1615, #157&lt;ul&gt;&lt;li&gt;HMMT 2025: 85.83 (#28/67)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#267/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok Code Fast 1&lt;/strong&gt; — ELO 1612, #162&lt;ul&gt;&lt;li&gt;Arena AI Code: 1164.51 (#111/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ling-3.0-flash&lt;/strong&gt; — ELO 1612, #164&lt;ul&gt;&lt;li&gt;ArtifactsBench: 77.0 (#1/8)&lt;/li&gt;&lt;li&gt;Multi-IF: 87.7 (#14/15)&lt;/li&gt;&lt;li&gt;MCP Atlas: 65.5 (#39/51)&lt;/li&gt;&lt;li&gt;AA-LCR: 67.0 (#105/210)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 92.0 (#112/130)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Haiku 4.5&lt;/strong&gt; — ELO 1609, #167&lt;ul&gt;&lt;li&gt;LLM2014 Code 2025-11 - Golang: 5.03 (#15/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - C++: 5.43 (#17/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - C#: 5.45 (#19/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11: 51.44 (#22/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - Java: 4.5 (#22/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - TypeScript: 5.58 (#22/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - Python: 4.87 (#23/26)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Measurement: 81.08 (#33/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Statistics and Probability: 28.57 (#33/76)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-01: 16.95 (#41/45)&lt;/li&gt;&lt;li&gt;...and 8 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 35B A3B&lt;/strong&gt; — ELO 1608, #169&lt;ul&gt;&lt;li&gt;Arena AI Code: 1249.75 (#100/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.6 (#144/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Codex Mini&lt;/strong&gt; — ELO 1608, #171&lt;ul&gt;&lt;li&gt;Arena AI Code: 1243.74 (#101/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KAT-Coder-Pro V1&lt;/strong&gt; — ELO 1605, #174&lt;ul&gt;&lt;li&gt;Arena AI Code: 1255.43 (#98/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Sonnet&lt;/strong&gt; — ELO 1602, #175&lt;ul&gt;&lt;li&gt;Video-MME: 60.0 (#31/51)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Flash&lt;/strong&gt; — ELO 1602, #176&lt;ul&gt;&lt;li&gt;Arena AI Code: 1330.17 (#89/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Nano&lt;/strong&gt; — ELO 1601, #177&lt;ul&gt;&lt;li&gt;APEX-Agents-AA: 0.25 (#41/56)&lt;/li&gt;&lt;li&gt;CritPt: 5.1 (#59/284)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 20.35 (#65/92)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 9.0 (#91/110)&lt;/li&gt;&lt;li&gt;AA GDPval: 738.5 (#143/219)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mercury 2&lt;/strong&gt; — ELO 1600, #180&lt;ul&gt;&lt;li&gt;Arena AI Code: 1166.17 (#110/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Next 80B A3B&lt;/strong&gt; — ELO 1597, #182&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2025-09: 43.59 (#13/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 Mini&lt;/strong&gt; — ELO 1597, #183&lt;ul&gt;&lt;li&gt;ComplexFuncBench: 17.6 (#14/20)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 10.53 (#80/92)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3 Super&lt;/strong&gt; — ELO 1596, #188&lt;ul&gt;&lt;li&gt;AA-LCR: 60.3333 (#139/210)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2&lt;/strong&gt; — ELO 1595, #189&lt;ul&gt;&lt;li&gt;LLM2014 Code 2025-11 - Python: 7.57 (#10/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - C++: 5.82 (#11/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - C#: 5.95 (#17/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - Golang: 3.2 (#20/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - Java: 4.7 (#21/26)&lt;/li&gt;&lt;li&gt;LLM2014 Code 2025-11 - TypeScript: 4.9 (#25/26)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1297.0 (#94/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Medium 3.5&lt;/strong&gt; — ELO 1595, #190&lt;ul&gt;&lt;li&gt;Arena AI Code: 1265.04 (#97/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#282/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 Mini (2025-01-31)&lt;/strong&gt; — ELO 1591, #195&lt;ul&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 7.0 (#95/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o&lt;/strong&gt; — ELO 1590, #196&lt;ul&gt;&lt;li&gt;Video-MME: 71.9 (#7/51)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Devstral 2&lt;/strong&gt; — ELO 1590, #200&lt;ul&gt;&lt;li&gt;Arena AI Code: 1193.51 (#108/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Coder 480B A35B Instruct&lt;/strong&gt; — ELO 1590, #201&lt;ul&gt;&lt;li&gt;Arena AI Code: 1273.25 (#95/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 12B&lt;/strong&gt; — ELO 1590, #202&lt;ul&gt;&lt;li&gt;AI for Education Pedagogy - Technology: 85.85 (#29/243)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 77.06 (#99/235)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Primary: 85.45 (#102/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Secondary: 81.29 (#102/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy: 81.65 (#105/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Maths: 80.16 (#108/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Science: 82.51 (#109/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Social studies: 78.18 (#116/243)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-OSS-120B&lt;/strong&gt; — ELO 1589, #203&lt;ul&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 2.0 (#109/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3.5 Lightning&lt;/strong&gt; — ELO 1588, #208&lt;ul&gt;&lt;li&gt;AI for Education Pedagogy - Social studies: 81.82 (#95/243)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 95.0 (#103/130)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Science: 81.97 (#113/243)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 74.31 (#114/235)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy: 78.75 (#119/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Secondary: 77.99 (#119/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Primary: 83.1 (#121/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Maths: 74.6 (#140/243)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Technology: 75.47 (#158/243)&lt;/li&gt;&lt;li&gt;AA-LCR: 55.3333 (#159/210)&lt;/li&gt;&lt;li&gt;...and 1 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 Mini&lt;/strong&gt; — ELO 1587, #210&lt;ul&gt;&lt;li&gt;LLM2014 Code 2025-07: 50.87 (#6/19)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-04: 54.55 (#10/29)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-05: 53.52 (#10/32)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-06: 48.53 (#14/38)&lt;/li&gt;&lt;li&gt;RealWorldQA: 78.69 (#15/48)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2025-08: 33.51 (#26/45)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 6.67 (#84/92)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 7.0 (#98/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.6V&lt;/strong&gt; — ELO 1585, #215&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#230/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o (2024-11-20)&lt;/strong&gt; — ELO 1580, #223&lt;ul&gt;&lt;li&gt;ComplexFuncBench: 66.5 (#1/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o (2024-08-06)&lt;/strong&gt; — ELO 1579, #227&lt;ul&gt;&lt;li&gt;ComplexFuncBench: 60.5 (#5/20)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 0.35 (#91/92)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 26B A4B&lt;/strong&gt; — ELO 1578, #232&lt;ul&gt;&lt;li&gt;BIG-Bench Extra Hard: 64.8 (#2/17)&lt;/li&gt;&lt;li&gt;MedXpertQA: 58.1 (#10/26)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Measurement: 83.78 (#32/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Number and Operations: 51.35 (#33/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths: 58.65 (#35/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Geometry: 52.31 (#35/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Algebra: 76.92 (#37/76)&lt;/li&gt;&lt;li&gt;AI for Education Visual Maths - Statistics and Probability: 14.29 (#50/76)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1361.65 (#77/113)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#240/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 9B&lt;/strong&gt; — ELO 1577, #236&lt;ul&gt;&lt;li&gt;MedXpertQA: 49.9 (#11/26)&lt;/li&gt;&lt;li&gt;LVBench: 70.0 (#14/40)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 12.0 (#117/182)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 61.67 (#146/256)&lt;/li&gt;&lt;li&gt;CritPt: 0.3 (#162/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Nano&lt;/strong&gt; — ELO 1573, #243&lt;ul&gt;&lt;li&gt;HMMT 2025: 74.17 (#39/67)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 5.96 (#86/92)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 9.0 (#88/110)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#214/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 3&lt;/strong&gt; — ELO 1572, #245&lt;ul&gt;&lt;li&gt;Arena AI Code: 1230.14 (#105/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash Lite&lt;/strong&gt; — ELO 1569, #247&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#253/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Haiku 4.5 (20251001)&lt;/strong&gt; — ELO 1568, #249&lt;ul&gt;&lt;li&gt;DeepResearchBench: 45.5 (#29/41)&lt;/li&gt;&lt;li&gt;SimpleQA Verified: 13.2 (#62/66)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1327.41 (#90/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small 4&lt;/strong&gt; — ELO 1568, #253&lt;ul&gt;&lt;li&gt;CritPt: 0.3 (#171/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Pro&lt;/strong&gt; — ELO 1562, #262&lt;ul&gt;&lt;li&gt;Video-MME: 75.0 (#2/51)&lt;/li&gt;&lt;li&gt;PhysicsFinals: 38.4 (#4/33)&lt;/li&gt;&lt;li&gt;Natural2Code: 42.3 (#7/24)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 32B&lt;/strong&gt; — ELO 1553, #282&lt;ul&gt;&lt;li&gt;MemPoison - Clean Task: 94.92 (#5/10)&lt;/li&gt;&lt;li&gt;MemPoison - Poisoned Task: 2.18 (#9/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.7 Flash&lt;/strong&gt; — ELO 1552, #284&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#227/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.5V&lt;/strong&gt; — ELO 1552, #286&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#233/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 14B&lt;/strong&gt; — ELO 1543, #309&lt;ul&gt;&lt;li&gt;MemPoison - Poisoned Task: 2.64 (#6/10)&lt;/li&gt;&lt;li&gt;MemPoison - Clean Task: 94.28 (#7/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 VL 72B Instruct&lt;/strong&gt; — ELO 1540, #316&lt;ul&gt;&lt;li&gt;OmniDocBench 1.5: 87.02 (#40/73)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;QwQ-32B&lt;/strong&gt; — ELO 1537, #327&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 5.0 (#149/182)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 59.17 (#150/256)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 4B&lt;/strong&gt; — ELO 1536, #328&lt;ul&gt;&lt;li&gt;MedXpertQA: 42.9 (#14/26)&lt;/li&gt;&lt;li&gt;LVBench: 66.4 (#16/40)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 (0613)&lt;/strong&gt; — ELO 1536, #330&lt;ul&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 12.0 (#78/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Devstral Medium&lt;/strong&gt; — ELO 1535, #332&lt;ul&gt;&lt;li&gt;Arena AI Code: 1080.11 (#113/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-OSS-20B&lt;/strong&gt; — ELO 1532, #341&lt;ul&gt;&lt;li&gt;CritPt: 1.4 (#101/284)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 65.28 (#139/256)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 4.0 (#156/182)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 136.81 (#363/507)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Flash&lt;/strong&gt; — ELO 1521, #359&lt;ul&gt;&lt;li&gt;Video-MME: 70.3 (#11/51)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EXAONE 4.0 32B&lt;/strong&gt; — ELO 1516, #364&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#257/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 27B&lt;/strong&gt; — ELO 1514, #367&lt;ul&gt;&lt;li&gt;BIG-Bench Extra Hard: 4.9 (#12/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 12B (IT)&lt;/strong&gt; — ELO 1513, #370&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 0.0 (#175/182)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 16.67 (#207/256)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o Mini&lt;/strong&gt; — ELO 1511, #376&lt;ul&gt;&lt;li&gt;ComplexFuncBench: 38.6 (#12/20)&lt;/li&gt;&lt;li&gt;Video-MME: 64.8 (#22/51)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 0.7 (#89/92)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o Mini (2024-07-18)&lt;/strong&gt; — ELO 1511, #377&lt;ul&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 12.0 (#82/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-4&lt;/strong&gt; — ELO 1508, #383&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 1.0 (#170/182)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Granite 4.1 8B&lt;/strong&gt; — ELO 1508, #385&lt;ul&gt;&lt;li&gt;Arena AI Code: 1191.25 (#109/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 8B&lt;/strong&gt; — ELO 1496, #401&lt;ul&gt;&lt;li&gt;MemPoison - Clean Task: 95.17 (#3/10)&lt;/li&gt;&lt;li&gt;MemPoison - Poisoned Task: 2.76 (#5/10)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 5.0 (#150/182)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 56.11 (#156/256)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 12B&lt;/strong&gt; — ELO 1489, #416&lt;ul&gt;&lt;li&gt;BIG-Bench Extra Hard: 4.5 (#13/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 2B&lt;/strong&gt; — ELO 1466, #452&lt;ul&gt;&lt;li&gt;MedXpertQA: 26.9 (#19/26)&lt;/li&gt;&lt;li&gt;LVBench: 57.1 (#19/40)&lt;/li&gt;&lt;li&gt;HMMT 2025: 22.9 (#60/67)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E4B&lt;/strong&gt; — ELO 1463, #465&lt;ul&gt;&lt;li&gt;CritPt: 0.3 (#184/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 4B (IT)&lt;/strong&gt; — ELO 1457, #476&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 0.0 (#173/182)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 7.5 (#219/256)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 8B Instruct&lt;/strong&gt; — ELO 1454, #481&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 0.0 (#177/182)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 8B&lt;/strong&gt; — ELO 1439, #512&lt;ul&gt;&lt;li&gt;MemPoison - Poisoned Task: 3.29 (#2/10)&lt;/li&gt;&lt;li&gt;MemPoison - Clean Task: 91.21 (#10/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-3.5 Turbo (0125)&lt;/strong&gt; — ELO 1428, #534&lt;ul&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 3.0 (#108/110)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E2B&lt;/strong&gt; — ELO 1425, #536&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#237/284)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 4B&lt;/strong&gt; — ELO 1408, #563&lt;ul&gt;&lt;li&gt;BIG-Bench Extra Hard: 3.4 (#16/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 0.8B&lt;/strong&gt; — ELO 1398, #576&lt;ul&gt;&lt;li&gt;LVBench: 45.1 (#23/40)&lt;/li&gt;&lt;li&gt;MedXpertQA: 17.1 (#26/26)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 1B (IT)&lt;/strong&gt; — ELO 1370, #609&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 0.0 (#174/182)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 1.11 (#249/256)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Arcee Trinity Large&lt;/strong&gt; — ELO 1605&lt;ul&gt;&lt;li&gt;Arena AI Code: 1238.37 (#103/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Mythos Preview&lt;/strong&gt; — ELO 1779&lt;ul&gt;&lt;li&gt;OSWorld-Verified: 85.4 (#3/132)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Doubao-Seed-1.6&lt;/strong&gt; — ELO 1628&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 32.6 (#26/35)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4 32B&lt;/strong&gt; — ELO 1566&lt;ul&gt;&lt;li&gt;MemPoison - Clean Task: 94.83 (#6/10)&lt;/li&gt;&lt;li&gt;MemPoison - Poisoned Task: 2.64 (#7/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 ChatGPT&lt;/strong&gt; — ELO 1647&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 1363.0 (#19/261)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 837.0 (#98/320)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Pro Sol&lt;/strong&gt; — ELO 1780&lt;ul&gt;&lt;li&gt;Epoch AI - ECI: 161.06 (#26/507)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.1&lt;/strong&gt; — ELO 1650&lt;ul&gt;&lt;li&gt;Arena AI Code: 1209.85 (#107/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2 Turbo&lt;/strong&gt; — ELO 1654&lt;ul&gt;&lt;li&gt;Arena AI Code: 1322.87 (#92/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LFM2.5-2.6B&lt;/strong&gt; — ELO 1512&lt;ul&gt;&lt;li&gt;BenchLM: 43.0 (#181/200)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna M.1&lt;/strong&gt; — ELO 1570&lt;ul&gt;&lt;li&gt;Arena AI Code: 1347.31 (#84/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna XS.2&lt;/strong&gt; — ELO 1548&lt;ul&gt;&lt;li&gt;Arena AI Code: 1301.97 (#93/113)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nova 2 Lite&lt;/strong&gt; — ELO 1550&lt;ul&gt;&lt;li&gt;ParseBench: 40.43 (#50/56)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Flash&lt;/strong&gt; — ELO 1642&lt;ul&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 15.0 (#65/110)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 19.3 (#67/92)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 92.0 (#110/130)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 1.8&lt;/strong&gt; — ELO 1640&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2025-12: 63.06 (#9/51)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Solar Pro 3&lt;/strong&gt; — ELO 1552&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 85.0 (#121/130)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Solar Pro 4&lt;/strong&gt; — ELO 1649&lt;ul&gt;&lt;li&gt;MCP Atlas: 61.4 (#42/51)&lt;/li&gt;&lt;li&gt;AA-LCR: 70.6667 (#72/210)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 100.0 (#85/130)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Spark X2&lt;/strong&gt; — ELO 1562&lt;ul&gt;&lt;li&gt;LLM2014 Logic 2026-02: 28.21 (#31/46)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-03: 25.04 (#34/42)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-04: 20.55 (#38/42)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-05: 14.04 (#40/43)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-06: 11.14 (#40/43)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-07: 6.21 (#44/45)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;deepseek-llm-67B-chat&lt;/strong&gt; — ELO 1490&lt;ul&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 0.0 (#176/182)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 0.83 (#252/256)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;uitars-1.5-7B&lt;/strong&gt; — ELO 1467&lt;ul&gt;&lt;li&gt;MobileGym-Bench: 13.8 (#8/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (107)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths: 86.92 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths - Algebra: 92.31 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths - Geometry: 83.85 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths - Measurement: 97.3 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths - Number and Operations: 86.49 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths - Statistics and Probability: 71.43 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on MCP Atlas: 83.3 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on OSWorld-Verified: 85.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on PostTrainBench: 41.79 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Mythos Preview&lt;/strong&gt; on OSWorld-Verified: 85.4 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA-LCR: 78.6667 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths: 80.59 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths - Algebra: 96.15 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths - Geometry: 75.38 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths - Measurement: 94.59 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths - Number and Operations: 75.68 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths - Statistics and Probability: 71.43 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on APEX v1: 68.6 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Appwrite Arena (With Skills): 97.4 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Appwrite Arena (Without Skills): 97.4 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on CAIS Risk Index: 44.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on CAIS Vision Capabilities Index: 63.9 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on CritPt: 29.1 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM2014 Logic 2026-07: 71.88 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM2014 Logic 2026-08: 64.74 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on MCP Atlas: 85.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Code - Comprehensive: 93.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Knowledge - Common Sense: 92.1 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Knowledge - Engineering: 93.3 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Knowledge - Humanities: 92.9 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Knowledge - Science: 97.5 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Knowledge - Social Science: 94.6 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass LLM - Code: 93.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass LLM - Knowledge: 94.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass LLM - Math: 77.3 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass LLM - Reasoning: 68.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Math - College: 79.9 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Math - Competition: 74.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Reasoning - Academic: 56.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Reasoning - Common: 80.1 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on PostTrainBench: 35.04 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on React Native Evals: 88.11 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Terminal-Bench 2.1: 51.8 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Terminal-Bench 2.1 (Claude Code): 51.8 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI ProgramBench: 82.27 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Pro Sol&lt;/strong&gt; on Epoch AI - ECI: 161.06 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Maths - Algebra: 96.15 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Maths - Measurement: 97.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Maths - Statistics and Probability: 57.14 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Appwrite Arena (With Skills): 96.9 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Appwrite Arena (Without Skills): 95.5 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Chatbot Arena (Search): 1257.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Crosby micro1 RedlineBench: 56.2 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Mystery Game Puzzles: 33.0 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on FrontierCode: 60.6 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on MCP Atlas: 81.8 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Code - Comprehensive: 96.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Knowledge - Common Sense: 86.3 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Knowledge - Engineering: 84.2 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Knowledge - Humanities: 90.8 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Knowledge - Science: 89.2 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Knowledge - Social Science: 92.1 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass LLM - Code: 96.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass LLM - Knowledge: 88.5 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass LLM - Math: 71.4 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass LLM - Reasoning: 66.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Math - College: 74.3 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Math - Competition: 68.6 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Reasoning - Academic: 55.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Reasoning - Common: 77.8 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SWE Atlas: 46.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Terminal-Bench 2.1: 37.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA-LCR: 81.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths: 89.45 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths - Algebra: 92.31 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths - Geometry: 90.77 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths - Measurement: 97.3 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths - Number and Operations: 81.08 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths - Statistics and Probability: 57.14 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AIIQ Composite IQ: 122.0 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Appwrite Arena (With Skills): 96.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Appwrite Arena (Without Skills): 93.6 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on BoundaryBench (NIST High): 66.7 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on BoundaryBench (Unrestricted): 79.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Bullshit Benchmark: 23.6 (#99)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on CAIS Risk Index: 60.7 (#33)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on CAIS Vision Capabilities Index: 63.7 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on CritPt: 14.3 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Epoch AI - Rli: 5.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Featherbench: 93.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Featherbench - Rubric Quality: 8.8 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Guesswork 2026-08: 0.9969 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Code - Comprehensive: 89.3 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Knowledge - Common Sense: 92.9 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Knowledge - Engineering: 95.8 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Knowledge - Humanities: 94.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Knowledge - Science: 95.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Knowledge - Social Science: 92.1 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass LLM - Code: 89.3 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass LLM - Knowledge: 94.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass LLM - Math: 76.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass LLM - Reasoning: 62.1 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Math - Competition: 67.9 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Reasoning - Academic: 47.4 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Reasoning - Common: 76.8 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on SEAL - Remote Labor Index (RLI): 5.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on TaxCalcBench: 12.0 (#14)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (51)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;ACEBench&lt;/strong&gt;: GPT-4o (2024-11-20) (89.6) beat Hammer2.1-3B-local by 82.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Slides)&lt;/strong&gt;: playyy (1316.0) beat Claude 3 Opus by 73.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GDPval-MM&lt;/strong&gt;: GPT-5.2 (70.9) beat GPT-4o by 58.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass LLM - Code&lt;/strong&gt;: GPT-5.5 (High) (96.5) beat Claude Opus 4.7 (High) by 32.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Code - Comprehensive&lt;/strong&gt;: GPT-5.5 (High) (96.5) beat Claude Opus 4.7 (High) by 32.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Lean AI Formalization Leaderboard&lt;/strong&gt;: Axiom Prover (Axiom Math) (205.0) beat Humanifa + GPT 5.6 sol by 22.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SWE Atlas&lt;/strong&gt;: Hy4 preview claude-code (64.0) beat GPT-5.5 by 18.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PostTrainBench&lt;/strong&gt;: Claude Fable 5 (Max) (41.79) beat Claude Opus 4.6 by 18.59&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - BioSecBench-Refusal&lt;/strong&gt;: Grok 4.6 (64.2) beat Gemini 3.5 Flash by 12.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Multi-IF&lt;/strong&gt;: Llama 3.1 8B (69.0) beat GPT-4.1 Nano by 11.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SWE-Milestone&lt;/strong&gt;: GLM-5.3 (58.75) beat Claude Opus 4.8 (Max, 1M) by 6.91&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Humanity's Last Exam (Self-Reported, With Tools)&lt;/strong&gt;: GLM-5.3 (62.5) beat Ornith-1.5-397B by 6.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Crosby micro1 RedlineBench&lt;/strong&gt;: Claude Opus 5 (56.9) beat GPT-5.5 by 6.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FEV-Bench - WAPE&lt;/strong&gt;: TimesFM-3 (85.23) beat Toto-2.0-2.5B by 6.23&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Maths - Number and Operations&lt;/strong&gt;: GPT-5.6 Sol (89.19) beat GPT-5.5 by 5.41&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WildClawBench&lt;/strong&gt;: GPT-5.6 Sol (67.2) beat Claude Opus 4.7 by 5.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Reasoning - Academic&lt;/strong&gt;: Claude Opus 5 (High) (56.7) beat GPT-5.4 (High) by 4.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FEV-Bench&lt;/strong&gt;: TimesFM-3 (85.93) beat Chronos-2 by 4.61&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FEV-Bench - WQL&lt;/strong&gt;: TimesFM-3 (86.37) beat Chronos-2 by 4.58&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ArtifactsBench&lt;/strong&gt;: Ling-3.0-flash (77.0) beat GPT-5 by 4.45&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FEV-Bench - MASE&lt;/strong&gt;: TimesFM-3 (84.97) beat Chronos-2 by 4.11&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Search)&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (1257.0) beat Claude Opus 4.6 by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Featherbench&lt;/strong&gt;: GLM-5.3 (100.0) beat Gemini 3.6 Flash by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FEV-Bench - SQL&lt;/strong&gt;: TimesFM-3 (87.17) beat Chronos-2 by 3.27&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass LLM - Reasoning&lt;/strong&gt;: Claude Opus 5 (High) (68.4) beat Doubao-Seed-2-0-Pro-260215 (High) by 3.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text-to-Video)&lt;/strong&gt;: Gemini 1.1 Flash (1515.0) beat gemini-omni-flash by 3.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Video Edit)&lt;/strong&gt;: wan3.0 (1414.0) beat dreamina-seedance-2.5-720p by 3.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (Toolathlon)&lt;/strong&gt;: GLM-5.3 Flash (78.4) beat Muse Spark 1.1 by 2.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Open Universal Arabic ASR Leaderboard&lt;/strong&gt;: Audar-ASR-V1-Turbo (23.17) beat cohere-transcribe-arabic-07-2026 by 2.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DuelLab Overall&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (87.3) beat Claude Fable 5 (xHigh) by 2.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Math - Competition&lt;/strong&gt;: Claude Opus 5 (High) (74.7) beat Kimi K2.6 by 2.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMEB Leaderboard&lt;/strong&gt;: WeMM-Embedding-9B (59.55) beat Ovis-Omni-Embedding-v0.5-3B by 2.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Open Universal Arabic ASR Leaderboard - CER&lt;/strong&gt;: Audar-ASR-V1-Turbo (9.23) beat cohere-transcribe-arabic-07-2026 by 2.57&lt;/li&gt;&lt;li&gt;&lt;strong&gt;HieroglyphBench&lt;/strong&gt;: Gemini 3.7 Flash (55.0) beat Gemini 3.5 Flash by 2.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Maths - Geometry&lt;/strong&gt;: GPT-5.6 Sol (90.77) beat GPT-5.5 by 2.31&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Math - College&lt;/strong&gt;: Gemini 3.7 Flash (85.6) beat Doubao-Seed-2-0-Pro-260215 (High) by 1.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AndroidWorld&lt;/strong&gt;: Gemini 3.7 Flash, Gemini Robotics ER 2 (99.1) beat AGI-0 by 1.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RealWorldQA&lt;/strong&gt;: Qwen3.8-Flash-Next (88.5) beat Qwen 3.7 Plus by 1.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Maths&lt;/strong&gt;: GPT-5.6 Sol (91.14) beat GPT-5.5 by 1.27&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (MVBench)&lt;/strong&gt;: GLM-5.3 Flash (77.8) beat Qwen 3.5 122B A10B by 1.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMEB Image&lt;/strong&gt;: WeMM-Embedding-9B (80.99) beat QQMM-embed-v4 by 1.18&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agents' Last Exam&lt;/strong&gt;: Claude Opus 5 (31.6) beat GPT-5.6 Sol by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI ProofBench&lt;/strong&gt;: alephprover (100.0) beat Claude Opus 5 by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AIIQ Composite IQ&lt;/strong&gt;: fable-5 (137.0) beat GPT-5.6 Sol by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Knowledge - Humanities&lt;/strong&gt;: Grok 4.6 (High) (95.8) beat Doubao-Seed-2-0-Pro-260215 (High) by 0.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SecIT Bench (Pydantic AI)&lt;/strong&gt;: GLM-5.3 (81.44) beat Grok 4.6 by 0.79&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (AutomationBench)&lt;/strong&gt;: GLM-5.3 Flash (48.8) beat GLM-5.3 by 0.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Bash Recovery&lt;/strong&gt;: Claude Opus 5 (Max) (15.25) beat GPT-5.5 (xHigh) by 0.58&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (RealWorldQA)&lt;/strong&gt;: Qwen3.8-Flash-Next (88.5) beat Qwen 3.8 Max by 0.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Praise vs Complaint&lt;/strong&gt;: Claude Opus 4.8 (High) (22.6) beat GPT-5.6 Sol (xHigh) by 0.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Appwrite Arena (With Skills)&lt;/strong&gt;: Muse Spark 1.2 (97.8) beat GPT-5.5 by 0.1&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-30

=== DAILY ===
NEW SCORES FROM TOP-10 MODELS (15)
  - Claude Opus 5 on Appwrite Arena (With Skills): 97.4 Overall Score (%) (#4/24)
  - Claude Opus 5 on Appwrite Arena (Without Skills): 97.4 Overall Score (%) (#3/24)
  - Claude Opus 5 on LLM2014 Logic 2026-07: 71.88</summary></entry><entry><title>The Aggregate Digest — 2026-08-29</title><id>https://theaggregate.ai/digest/2026-08-29</id><updated>2026-08-29T11:40:29.518756+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Text)&lt;/strong&gt; (Elo): leader Claude Fable 5 (1507.0), 395 models&lt;br&gt;&lt;span&gt;Crowdsourced Elo-rated leaderboard where users blindly compare LLM responses in pairwise battles across diverse real-world text prompts.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (69)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on MCP Atlas: 83.3 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on OSWorld-Verified: 85.96 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Mythos 5&lt;/strong&gt; on ArxivMath: 78.52 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Mythos Preview&lt;/strong&gt; on ArxivMath: 68.7 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on ArxivMath: 91.33 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on MCP Atlas: 85.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Code - Comprehensive: 93.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Knowledge - Common Sense: 92.1 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Knowledge - Engineering: 93.3 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Knowledge - Humanities: 92.9 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Knowledge - Science: 97.5 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Knowledge - Social Science: 94.6 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass LLM - Code: 93.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass LLM - Knowledge: 94.1 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass LLM - Math: 77.3 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass LLM - Reasoning: 68.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Math - College: 79.9 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Math - Competition: 74.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Reasoning - Academic: 56.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenCompass Reasoning - Common: 80.1 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Chatbot Arena (Search): 1257.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on FrontierCode: 60.6 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on MCP Atlas: 81.8 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Code - Comprehensive: 96.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Knowledge - Common Sense: 86.3 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Knowledge - Engineering: 84.2 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Knowledge - Humanities: 90.8 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Knowledge - Science: 89.2 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Knowledge - Social Science: 92.1 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass LLM - Code: 96.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass LLM - Knowledge: 88.5 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass LLM - Math: 71.4 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass LLM - Reasoning: 66.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Math - College: 74.3 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Math - Competition: 68.6 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Reasoning - Academic: 55.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenCompass Reasoning - Common: 77.8 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SWE Atlas: 46.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on WildClawBench: 67.2 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Code - Comprehensive: 89.3 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Knowledge - Common Sense: 92.9 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Knowledge - Engineering: 95.8 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Knowledge - Humanities: 94.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Knowledge - Science: 95.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Knowledge - Social Science: 92.1 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass LLM - Code: 89.3 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass LLM - Knowledge: 94.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass LLM - Math: 76.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass LLM - Reasoning: 62.1 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Math - Competition: 67.9 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Reasoning - Academic: 47.4 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenCompass Reasoning - Common: 76.8 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on APEX-Agents-AA: 0.41 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LM Market Cap LMC Score: 40.0 (#248)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass Code - Comprehensive: 88.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass Knowledge - Common Sense: 87.9 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass Knowledge - Engineering: 88.3 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass Knowledge - Humanities: 92.1 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass Knowledge - Science: 92.5 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass Knowledge - Social Science: 90.4 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass LLM - Code: 88.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass LLM - Knowledge: 90.3 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass LLM - Math: 74.1 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass LLM - Reasoning: 63.9 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass Math - College: 79.2 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass Math - Competition: 68.9 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass Reasoning - Academic: 51.7 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on OpenCompass Reasoning - Common: 76.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on WildClawBench: 54.5 (#12)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (13)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;OpenCompass LLM - Code&lt;/strong&gt;: GPT-5.5 (High) (96.5) beat Claude Opus 4.7 (High) by 32.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Code - Comprehensive&lt;/strong&gt;: GPT-5.5 (High) (96.5) beat Claude Opus 4.7 (High) by 32.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Lean AI Formalization Leaderboard&lt;/strong&gt;: Axiom Prover (Axiom Math) (205.0) beat Humanifa + GPT 5.6 sol by 22.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SWE Atlas&lt;/strong&gt;: Hy4 preview claude-code (64.0) beat GPT-5.5 by 18.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Video)&lt;/strong&gt;: Gemini 1.1 Flash (1377.0) beat Gemini 2.0 Flash by 9.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Humanity's Last Exam (Self-Reported, With Tools)&lt;/strong&gt;: GLM-5.3 (62.5) beat Ornith-1.5-397B by 6.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Reasoning - Academic&lt;/strong&gt;: Claude Opus 5 (High) (56.7) beat GPT-5.4 (High) by 4.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Search)&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (1257.0) beat Claude Opus 4.6 by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass LLM - Reasoning&lt;/strong&gt;: Claude Opus 5 (High) (68.4) beat Doubao-Seed-2-0-Pro-260215 (High) by 3.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Math - Competition&lt;/strong&gt;: Claude Opus 5 (High) (74.7) beat Kimi K2.6 by 2.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Math - College&lt;/strong&gt;: Gemini 3.7 Flash (85.6) beat Doubao-Seed-2-0-Pro-260215 (High) by 1.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AndroidWorld&lt;/strong&gt;: Gemini 3.7 Flash, Gemini Robotics ER 2 (99.1) beat AGI-0 by 1.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenCompass Knowledge - Humanities&lt;/strong&gt;: Grok 4.6 (High) (95.8) beat Doubao-Seed-2-0-Pro-260215 (High) by 0.8&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-29

=== DAILY ===
NEW BENCHMARKS (1)
  - Chatbot Arena (Text) (Elo): leader Claude Fable 5 (1507.0), 395 models
      Crowdsourced Elo-rated leaderboard where users blindly compare LLM responses in pairwise battles across diverse real-world text prompts.

NEW SCORES FR</summary></entry><entry><title>The Aggregate Digest — 2026-08-26</title><id>https://theaggregate.ai/digest/2026-08-26</id><updated>2026-08-26T18:35:49.913992+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SWE Refactor Bench&lt;/strong&gt; (Score (out of 100)): leader Claude Opus 5 (47.0), 8 models&lt;br&gt;&lt;span&gt;A whole-repository stack migration held open for a hundred-odd steps: change the framework the codebase is built on and leave it working. Every model is run at each of its harness&amp;#x27;s effort tiers, and the best any of them manages is 47 out of 100 — the behavioural test suite mostly passes, the migration mostly does not.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EarthVerse&lt;/strong&gt; (Core Score (%)): leader Claude Fable 5 (84.97), 18 models&lt;br&gt;&lt;span&gt;Earth-system and natural-hazard analysis with real observational data: reconstruct what happened from sources that disagree on scale, timing and modality. Scored on the answer and the trajectory that produced it, so a right number reached by a wrong route does not count.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Pro Sol&lt;/strong&gt; on Epoch AI - ECI: 161.08 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Bullshit Benchmark: 23.6 (#99)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Epoch AI - Rli: 5.0 (#5)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (5)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Slides)&lt;/strong&gt;: playyy (1304.0) beat Claude 3 Opus by 61.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ArtifactsBench&lt;/strong&gt;: Ling-3.0-flash (77.0) beat GPT-5 by 4.45&lt;/li&gt;&lt;li&gt;&lt;strong&gt;HieroglyphBench&lt;/strong&gt;: Gemini 3.7 Flash (55.0) beat Gemini 3.5 Flash by 2.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BEAR-Bench&lt;/strong&gt;: Qwen 3.5 397B A17B (75.4) beat Gemini 3.1 Pro (Preview) by 0.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Longitudinal MRI Progression Reasoning&lt;/strong&gt;: InternVL3.5-Inst (35.15) beat Gemini 3 Pro by 0.05&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-26

=== DAILY ===
NEW BENCHMARKS (2)
  - SWE Refactor Bench (Score (out of 100)): leader Claude Opus 5 (47.0), 8 models
      A whole-repository stack migration held open for a hundred-odd steps: change the framework the codebase is built on and leave it working. Every</summary></entry><entry><title>The Aggregate Digest — 2026-08-25</title><id>https://theaggregate.ai/digest/2026-08-25</id><updated>2026-08-25T06:17:16.148062+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;DGEval - IMDG Code MCQ&lt;/strong&gt; (Accuracy (%)): leader Gemini 3.1 Pro (Preview) (95.8), 10 models&lt;br&gt;&lt;span&gt;The closed-book multiple-choice half of a dangerous-goods shipping certification, asked exactly as human candidates get it. Certified practitioners score 83.8 percent, which is the number every model on the board is measured against — and most of them are below it.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DGEval - Regulatory Recall&lt;/strong&gt; (Accuracy (%)): leader Gemini 3.1 Pro (Preview) (36.8), 10 models&lt;br&gt;&lt;span&gt;The section of the same maritime dangerous-goods exam that nothing saturates: name the IMDG Code provision a scenario falls under, from memory. Scores run from 0 to 37 percent, so it separates the frontier where the multiple-choice half no longer does.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VIALS&lt;/strong&gt; (Direct VLM Accuracy (%)): leader GPT-5.6 Sol (26.5), 7 models&lt;br&gt;&lt;span&gt;Gel blots, microscopy, plasmid maps, flow cytometry plots — the visual artifacts a working life scientist reads before deciding what to do next. Scored as direct vision-language accuracy with no tools, where the best model manages roughly a quarter of the questions.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (25)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths: 86.92 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths - Algebra: 92.31 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths - Geometry: 83.85 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths - Measurement: 97.3 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths - Number and Operations: 86.49 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on AI for Education Visual Maths - Statistics and Probability: 71.43 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths: 80.59 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths - Algebra: 96.15 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths - Geometry: 75.38 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths - Measurement: 94.59 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths - Number and Operations: 75.68 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AI for Education Visual Maths - Statistics and Probability: 71.43 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Roboflow Playground Open Prompt: 1200.0 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Maths - Algebra: 96.15 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Maths - Measurement: 97.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AI for Education Visual Maths - Statistics and Probability: 57.14 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths: 89.45 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths - Algebra: 92.31 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths - Geometry: 90.77 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths - Measurement: 97.3 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths - Number and Operations: 81.08 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Maths - Statistics and Probability: 57.14 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ProphetArena: 0.96 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on SEAL - Remote Labor Index (RLI): 5.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on TaxCalcBench: 12.0 (#14)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (5)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Benchmarks.bio - BioSecBench-Refusal&lt;/strong&gt;: Grok 4.6 (64.2) beat Gemini 3.5 Flash by 12.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Maths - Number and Operations&lt;/strong&gt;: GPT-5.6 Sol (89.19) beat GPT-5.5 by 5.41&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Maths - Geometry&lt;/strong&gt;: GPT-5.6 Sol (90.77) beat GPT-5.5 by 2.31&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Maths&lt;/strong&gt;: GPT-5.6 Sol (91.14) beat GPT-5.5 by 1.27&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SecIT Bench (Pydantic AI)&lt;/strong&gt;: GLM-5.3 (81.44) beat Grok 4.6 by 0.79&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-25

=== DAILY ===
NEW BENCHMARKS (3)
  - DGEval - IMDG Code MCQ (Accuracy (%)): leader Gemini 3.1 Pro (Preview) (95.8), 10 models
      The closed-book multiple-choice half of a dangerous-goods shipping certification, asked exactly as human candidates get it. Certified</summary></entry><entry><title>The Aggregate Digest — 2026-08-24</title><id>https://theaggregate.ai/digest/2026-08-24</id><updated>2026-08-24T10:31:51.987898+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;BenchGecko Score&lt;/strong&gt; (Composite Score): leader GPT-5.5 Pro (99.9), 20 models&lt;br&gt;&lt;span&gt;BenchGecko&amp;#x27;s own composite index over the public boards it tracks, mirrored here the way LLM Stats Score and BenchmarkList ECI are. Coverage per model is uneven — between 3 and 14 boards feed each score — so it reads as one aggregator&amp;#x27;s view rather than an independent measurement.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SAST False-Positive Triage&lt;/strong&gt; (Accuracy (%)): leader Kimi K3 (92.0), 15 models&lt;br&gt;&lt;span&gt;A static analyser fires 142 findings over a codebase and 11 of them are real. The model has to keep the genuine vulnerabilities and dismiss the noise, so the accuracy column punishes both misses and credulity. Published as a blog table, which is why the roster is small and current.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;StartupBench&lt;/strong&gt; (Score (%)): leader Kimi K3 (73.67), 9 models&lt;br&gt;&lt;span&gt;Ninety-seven market-research tasks drawn from real startup work across medicine, finance, legal, business, STEM and education, scored per domain and overall. Tasks are open-ended and judged item-wise on process logic rather than a single final answer, which is what separates it from the GAIA-style agent boards.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agentic Commerce World&lt;/strong&gt; (Overall (%)): leader GPT-5.6 Sol (85.6), 9 models&lt;br&gt;&lt;span&gt;Vibe commerce: state a buying or selling goal in natural language and delegate the transaction to an agent. Runs in an auditable, verifiable environment because commerce failures cost money rather than a retry.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VibeLifeBench&lt;/strong&gt; (Average of 3 runs (%)): leader Claude Opus 5 (32.5), 7 models&lt;br&gt;&lt;span&gt;Personal-assistant tasks that run for weeks in a world that changes underneath them, scored on proactivity and persistence. Deliberately unlike the short self-contained requests in a static environment that most agent evaluations use.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BusinessCaseBench&lt;/strong&gt; (Score (%)): leader Claude Sonnet 4.6 (88.4), 7 models&lt;br&gt;&lt;span&gt;Case-grounded professional knowledge work across the business disciplines - the judgement calls that benchmarks built on recall, narrow QA, maths and coding do not reach.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on BoundaryBench (NIST High): 66.7 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on BoundaryBench (Unrestricted): 79.8 (#3)&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-24

=== DAILY ===
NEW BENCHMARKS (6)
  - BenchGecko Score (Composite Score): leader GPT-5.5 Pro (99.9), 20 models
      BenchGecko's own composite index over the public boards it tracks, mirrored here the way LLM Stats Score and BenchmarkList ECI are. Coverage per mode</summary></entry><entry><title>The Aggregate Digest — 2026-08-23</title><id>https://theaggregate.ai/digest/2026-08-23</id><updated>2026-08-23T07:31:51.012044+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;Top-10 New Scores (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Agents' Last Exam: 27.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Arena AI Code: 1587.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LMArena Text Arena: 1489.87 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LMArena WebDev Arena: 1587.86 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Benchmarks.bio - BioSecBench-Refusal: 8.6 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Benchmarks.bio - BioSecBench-Surveillance: 48.3 (#12)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;MobileWorld - GUI Only&lt;/strong&gt;: Qwen-UI-Agent (82.1) beat Kimi K3 by 7.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WebVoyager&lt;/strong&gt;: browser-control (Fable 5) (99.19) beat Alumnium by 0.69&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Weekly&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;AtmosCoder-Bench&lt;/strong&gt; (Accuracy (%, mean of 3 runs)): leader GPT-5.5 (97.6), 16 models&lt;br&gt;&lt;span&gt;AtmosCoder-Bench grades quantitative atmospheric science by execution: each of 436 textbook-grounded problems is answered by a Python solve() the model writes, and the graded number is whatever that function computes, with the declared unit reconciled against ground truth. Three runs per model; accuracy (%) is the mean. Reasoning and thinking-off runs of the same checkpoint are listed separately, as upstream measures them.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (123)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; — ELO 1792, #1&lt;ul&gt;&lt;li&gt;Vals AI MedCode: 63.57 (#1/86)&lt;/li&gt;&lt;li&gt;Vals AI MedScribe: 90.98 (#1/87)&lt;/li&gt;&lt;li&gt;Vals AI MMMU: 89.88 (#1/90)&lt;/li&gt;&lt;li&gt;LiveMathematicianBench: 45.1 (#3/19)&lt;/li&gt;&lt;li&gt;Vals AI LegalBench: 86.97 (#5/139)&lt;/li&gt;&lt;li&gt;Agents' Last Exam: 27.0 (#7/25)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 96.4 (#9/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 68.3 (#9/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 66.7 (#12/14)&lt;/li&gt;&lt;li&gt;Epoch AI - Cursorbench: 64.3 (#16/67)&lt;/li&gt;&lt;li&gt;...and 1 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; — ELO 1786, #2&lt;ul&gt;&lt;li&gt;OpenAI GPT-5.5 Launch - FrontierMath Tier 1-3: 52.4 (#1/6)&lt;/li&gt;&lt;li&gt;OpenAI GPT-5.5 Launch - FrontierMath Tier 4: 39.6 (#1/6)&lt;/li&gt;&lt;li&gt;AA CritPt: 30.57 (#2/490)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; — ELO 1783, #3&lt;ul&gt;&lt;li&gt;FutureEval: 13.23 (#1/43)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 98.9 (#1/14)&lt;/li&gt;&lt;li&gt;Epoch AI - Enigma Eval: 39.28 (#1/46)&lt;/li&gt;&lt;li&gt;ArxivMath: 78.6 (#2/11)&lt;/li&gt;&lt;li&gt;FrontierCode: 46.3 (#3/22)&lt;/li&gt;&lt;li&gt;CyberGym: 83.8 (#3/23)&lt;/li&gt;&lt;li&gt;APEX v1: 66.0 (#4/5)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 66.6 (#4/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 66.6 (#5/39)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 68.3 (#8/14)&lt;/li&gt;&lt;li&gt;...and 4 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; — ELO 1777, #4&lt;ul&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 99.5 (#1/14)&lt;/li&gt;&lt;li&gt;Design Arena (UI Components): 1387.0 (#1/152)&lt;/li&gt;&lt;li&gt;Design Arena (Game Dev): 1414.0 (#2/157)&lt;/li&gt;&lt;li&gt;Design Arena (3D): 1438.0 (#2/145)&lt;/li&gt;&lt;li&gt;Epoch AI - Enigma Eval: 37.12 (#2/46)&lt;/li&gt;&lt;li&gt;CyberGym: 83.6 (#4/23)&lt;/li&gt;&lt;li&gt;Design Arena (Data Viz): 1338.0 (#5/153)&lt;/li&gt;&lt;li&gt;Toolathlon: 74.9 (#6/36)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 82.9 (#7/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 92.2 (#9/14)&lt;/li&gt;&lt;li&gt;...and 4 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; — ELO 1777, #5&lt;ul&gt;&lt;li&gt;ProphetArena: 0.9687 (#1/19)&lt;/li&gt;&lt;li&gt;Icelandic LLM Leaderboard - Average: 88.71 (#1/94)&lt;/li&gt;&lt;li&gt;Icelandic LLM - WinoGrande-IS: 96.32 (#1/94)&lt;/li&gt;&lt;li&gt;Icelandic LLM - ARC-Challenge-IS: 95.22 (#1/94)&lt;/li&gt;&lt;li&gt;Kaggle FACTS (Google): 71.27 (#1/33)&lt;/li&gt;&lt;li&gt;Kaggle FACTS Multimodal: 49.83 (#1/33)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning: 89.9 (#1/67)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - match (figure): 87.4 (#1/67)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - match (process): 88.9 (#1/67)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - pattern completion (linear): 95.7 (#1/67)&lt;/li&gt;&lt;li&gt;...and 60 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; — ELO 1761, #7&lt;ul&gt;&lt;li&gt;APEX v1: 68.4 (#2/5)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 64.3 (#2/39)&lt;/li&gt;&lt;li&gt;Toolathlon: 76.5 (#2/36)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 69.7 (#3/39)&lt;/li&gt;&lt;li&gt;NL2Repo: 58.0 (#3/25)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - odd one out: 79.2 (#4/67)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 66.4 (#5/39)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - reasoning by analogy: 83.7 (#5/67)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 73.2 (#7/39)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - match (process): 75.0 (#7/67)&lt;/li&gt;&lt;li&gt;...and 11 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.6&lt;/strong&gt; — ELO 1757, #8&lt;ul&gt;&lt;li&gt;AI for Education Pedagogy - Science: 96.72 (#1/235)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Secondary: 91.19 (#1/235)&lt;/li&gt;&lt;li&gt;Epoch AI - Cursorbench: 70.8 (#3/67)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy: 91.55 (#3/235)&lt;/li&gt;&lt;li&gt;EnterpriseBench (CoreCraft Agents): 65.6 (#3/3)&lt;/li&gt;&lt;li&gt;Epoch AI - Vending Bench 2: 9047.03 (#4/58)&lt;/li&gt;&lt;li&gt;AA GDPval: 1765.76 (#4/210)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Hard: 62.17 (#5/13)&lt;/li&gt;&lt;li&gt;Epoch AI - Apex Agents: 41.2 (#5/61)&lt;/li&gt;&lt;li&gt;Epoch AI - Blueprint Bench 2: 0.332 (#5/23)&lt;/li&gt;&lt;li&gt;...and 33 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; — ELO 1755, #9&lt;ul&gt;&lt;li&gt;WebDev Arena: 1666.72 (#4/111)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 11.62 (#6/51)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 58.0 (#9/22)&lt;/li&gt;&lt;li&gt;CyberGym: 78.5 (#11/23)&lt;/li&gt;&lt;li&gt;Agent Arena: 6.2 (#15/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 6.81 (#17/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 4.0 (#19/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 8.39 (#23/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Tool Hallucination: -0.18 (#39/51)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5&lt;/strong&gt; — ELO 1749, #10&lt;ul&gt;&lt;li&gt;OpenAI GPT-5.5 Launch - FrontierMath Tier 1-3: 51.7 (#2/6)&lt;/li&gt;&lt;li&gt;OpenAI GPT-5.5 Launch - FrontierMath Tier 4: 35.4 (#3/6)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 97.8 (#4/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 96.6 (#4/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 96.6 (#5/14)&lt;/li&gt;&lt;li&gt;ArxivMath: 72.2 (#5/11)&lt;/li&gt;&lt;li&gt;Epoch AI - Apex Agents: 38.5 (#10/61)&lt;/li&gt;&lt;li&gt;ParseBench: 64.39 (#17/56)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.2&lt;/strong&gt; — ELO 1749, #11&lt;ul&gt;&lt;li&gt;Agent Arena - Bash Recovery: 11.4 (#10/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 6.02 (#14/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Tool Hallucination: -1.13 (#17/51)&lt;/li&gt;&lt;li&gt;Creative Writing (Lechmazur): 0.6 (#20/47)&lt;/li&gt;&lt;li&gt;Agent Arena: 2.06 (#25/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: -2.51 (#32/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: -5.72 (#35/51)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.6 Flash&lt;/strong&gt; — ELO 1747, #12&lt;ul&gt;&lt;li&gt;APEX v1 Investment Banking: 69.2 (#2/39)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - pattern completion (2d): 83.6 (#2/67)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - pattern completion (linear): 92.3 (#2/67)&lt;/li&gt;&lt;li&gt;LVBench: 84.2 (#2/53)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning: 85.7 (#3/67)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - match (figure): 84.7 (#3/67)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - reasoning by analogy: 87.9 (#3/67)&lt;/li&gt;&lt;li&gt;AI for Education Visual Reasoning - match (process): 77.8 (#4/67)&lt;/li&gt;&lt;li&gt;BioMysteryBench Human-Difficult: 41.2 (#4/11)&lt;/li&gt;&lt;li&gt;APEX v1: 66.0 (#5/5)&lt;/li&gt;&lt;li&gt;...and 12 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; — ELO 1744, #13&lt;ul&gt;&lt;li&gt;Roboflow Playground Open Prompt: 1188.0 (#43/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; — ELO 1744, #14&lt;ul&gt;&lt;li&gt;CyberGym: 84.5 (#1/23)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Mega: 21.39 (#2/9)&lt;/li&gt;&lt;li&gt;Creative Writing (Lechmazur): 3.5 (#2/47)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 50.31 (#3/176)&lt;/li&gt;&lt;li&gt;AA GDPval: 1769.0 (#3/210)&lt;/li&gt;&lt;li&gt;NL2Repo: 58.0 (#4/25)&lt;/li&gt;&lt;li&gt;DeepSWE: 69.0 (#6/28)&lt;/li&gt;&lt;li&gt;Agents on Rails: 79.4 (#6/12)&lt;/li&gt;&lt;li&gt;Vals AI SWE-bench Verified: 95.4 (#6/86)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Code): 1599.0 (#8/118)&lt;/li&gt;&lt;li&gt;...and 33 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Pro (Preview)&lt;/strong&gt; — ELO 1739, #16&lt;ul&gt;&lt;li&gt;ArxivMath: 64.79 (#8/11)&lt;/li&gt;&lt;li&gt;GAIA: 55.48 (#591/3523)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; — ELO 1735, #17&lt;ul&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 97.8 (#2/14)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 64.0 (#3/39)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 96.6 (#4/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 94.4 (#5/14)&lt;/li&gt;&lt;li&gt;Epoch AI - Enigma Eval: 23.51 (#5/46)&lt;/li&gt;&lt;li&gt;ArxivMath: 71.0 (#6/11)&lt;/li&gt;&lt;li&gt;Agents on Rails: 79.4 (#7/12)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 62.6 (#9/39)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1475.0 (#11/38)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1564.26 (#13/111)&lt;/li&gt;&lt;li&gt;...and 6 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Terra&lt;/strong&gt; — ELO 1735, #18&lt;ul&gt;&lt;li&gt;APEX v1: 69.5 (#1/5)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 76.2 (#1/39)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 71.8 (#1/39)&lt;/li&gt;&lt;li&gt;BioMysteryBench Human-Difficult: 49.4 (#1/11)&lt;/li&gt;&lt;li&gt;MRCR-v2 128k: 93.5 (#2/20)&lt;/li&gt;&lt;li&gt;LVBench: 78.9 (#3/53)&lt;/li&gt;&lt;li&gt;Vals AI ProgramBench: 72.34 (#4/41)&lt;/li&gt;&lt;li&gt;Vals AI Code Migration: 47.8 (#4/51)&lt;/li&gt;&lt;li&gt;BioMysteryBench Human-Solvable: 83.8 (#4/11)&lt;/li&gt;&lt;li&gt;Vals AI SWE-bench Verified: 95.4 (#5/86)&lt;/li&gt;&lt;li&gt;...and 18 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash&lt;/strong&gt; — ELO 1734, #19&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 49.5 (#1/19)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 67.4 (#3/39)&lt;/li&gt;&lt;li&gt;Epoch AI - Enigma Eval: 25.41 (#3/46)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 61.7 (#11/39)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 50.6 (#14/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 44.9 (#14/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 49.4 (#14/14)&lt;/li&gt;&lt;li&gt;FutureEval: 10.01 (#17/43)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 66.2 (#21/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 53.6 (#25/39)&lt;/li&gt;&lt;li&gt;...and 1 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro (0813)&lt;/strong&gt; — ELO 1734, #20&lt;ul&gt;&lt;li&gt;ProphetArena: 0.9661 (#2/19)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 43.0 (#6/54)&lt;/li&gt;&lt;li&gt;Riemann-bench: 38.4 (#9/30)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 98.61 (#10/239)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1584.45 (#10/111)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 47.0 (#11/162)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 50.0 (#12/22)&lt;/li&gt;&lt;li&gt;SimpleQA Verified: 55.47 (#18/78)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 64.56 (#20/49)&lt;/li&gt;&lt;li&gt;FrontierMath - Tier 4 (v2): 26.83 (#23/51)&lt;/li&gt;&lt;li&gt;...and 3 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.5&lt;/strong&gt; — ELO 1729, #21&lt;ul&gt;&lt;li&gt;Roboflow Playground Object Detection: 1200.0 (#30/48)&lt;/li&gt;&lt;li&gt;Roboflow Playground Overall: 1200.0 (#40/72)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen3.8 2.4T A95B&lt;/strong&gt; — ELO 1725, #23&lt;ul&gt;&lt;li&gt;WeirdML: 75.24 (#21/155)&lt;/li&gt;&lt;li&gt;Arabic Broad Leaderboard: 8.862 (#23/109)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4&lt;/strong&gt; — ELO 1713, #27&lt;ul&gt;&lt;li&gt;OpenAI GPT-5.4 Launch - FrontierMath Tier 1-3: 47.6 (#2/3)&lt;/li&gt;&lt;li&gt;LiveMathematicianBench: 46.6 (#2/19)&lt;/li&gt;&lt;li&gt;OpenAI GPT-5.4 Launch - FrontierMath Tier 4: 27.1 (#3/4)&lt;/li&gt;&lt;li&gt;OpenAI GPT-5.5 Launch - FrontierMath Tier 1-3: 47.6 (#4/6)&lt;/li&gt;&lt;li&gt;OpenAI GPT-5.5 Launch - FrontierMath Tier 4: 27.1 (#4/6)&lt;/li&gt;&lt;li&gt;Epoch AI - Enigma Eval: 15.96 (#9/46)&lt;/li&gt;&lt;li&gt;ParseBench: 62.23 (#23/56)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.7&lt;/strong&gt; — ELO 1711, #28&lt;ul&gt;&lt;li&gt;LMArena Text Arena: 1502.01 (#3/24)&lt;/li&gt;&lt;li&gt;OpenAI GPT-5.5 Launch - FrontierMath Tier 1-3: 43.8 (#5/6)&lt;/li&gt;&lt;li&gt;OpenAI GPT-5.5 Launch - FrontierMath Tier 4: 22.9 (#5/6)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1497.0 (#6/38)&lt;/li&gt;&lt;li&gt;scBench: 55.3 (#6/17)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 63.3 (#7/39)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 70.9 (#10/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 61.0 (#15/39)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1557.31 (#15/111)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1557.29 (#15/25)&lt;/li&gt;&lt;li&gt;...and 3 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 5&lt;/strong&gt; — ELO 1711, #29&lt;ul&gt;&lt;li&gt;BioMysteryBench Human-Solvable: 87.5 (#1/11)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 63.9 (#5/39)&lt;/li&gt;&lt;li&gt;BioMysteryBench Human-Difficult: 34.1 (#6/11)&lt;/li&gt;&lt;li&gt;FutureEval: 11.34 (#10/43)&lt;/li&gt;&lt;li&gt;LVBench: 68.5 (#16/53)&lt;/li&gt;&lt;li&gt;AA GDPval: 1502.39 (#33/210)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 54.4 (#34/39)&lt;/li&gt;&lt;li&gt;Epoch AI - Cursorbench: 56.9 (#38/67)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 41.1 (#39/39)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 39.1 (#39/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Luna&lt;/strong&gt; — ELO 1709, #30&lt;ul&gt;&lt;li&gt;CritPt: 20.6 (#12/213)&lt;/li&gt;&lt;li&gt;Epoch AI - Cursorbench: 61.1 (#26/67)&lt;/li&gt;&lt;li&gt;ParseBench: 56.32 (#30/56)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 27B&lt;/strong&gt; — ELO 1706, #33&lt;ul&gt;&lt;li&gt;BRIDGE Medical Leaderboard - Few-Shot: 55.67 (#1/109)&lt;/li&gt;&lt;li&gt;BRIDGE Medical Leaderboard: 48.31 (#2/109)&lt;/li&gt;&lt;li&gt;BRIDGE Medical Leaderboard - Zero-Shot: 46.61 (#2/109)&lt;/li&gt;&lt;li&gt;RealWorldQA: 85.9 (#2/14)&lt;/li&gt;&lt;li&gt;BRIDGE Medical Leaderboard - CoT: 44.92 (#3/109)&lt;/li&gt;&lt;li&gt;OpenRouter Tau2-Bench Airline: 80.7 (#3/114)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 84.3 (#3/29)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 48.04 (#5/176)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 11.25 (#5/52)&lt;/li&gt;&lt;li&gt;Vals AI SAGE: 52.4 (#6/77)&lt;/li&gt;&lt;li&gt;...and 53 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Pro&lt;/strong&gt; — ELO 1705, #35&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 18.75 (#7/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.6&lt;/strong&gt; — ELO 1703, #38&lt;ul&gt;&lt;li&gt;LMArena Text Arena: 1504.49 (#2/24)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1506.0 (#3/38)&lt;/li&gt;&lt;li&gt;NL2Repo: 47.6 (#10/25)&lt;/li&gt;&lt;li&gt;RealWorldQA: 73.9 (#11/14)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1545.76 (#17/25)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 72.7 (#17/29)&lt;/li&gt;&lt;li&gt;Epoch AI - Enigma Eval: 7.6 (#18/46)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1546.0 (#18/48)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1544.94 (#21/111)&lt;/li&gt;&lt;li&gt;ComplexConstraints: 36.3 (#24/57)&lt;/li&gt;&lt;li&gt;...and 1 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Flash&lt;/strong&gt; — ELO 1703, #39&lt;ul&gt;&lt;li&gt;DystopiaBench: 77.0 (#40/42)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.2&lt;/strong&gt; — ELO 1703, #40&lt;ul&gt;&lt;li&gt;APEX v1 Investment Banking: 62.6 (#10/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 62.1 (#12/39)&lt;/li&gt;&lt;li&gt;CyberGym: 77.2 (#12/23)&lt;/li&gt;&lt;li&gt;FutureEval: 9.29 (#24/43)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 64.9 (#25/39)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 56.3 (#27/39)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 82.7 (#76/428)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.7 Code&lt;/strong&gt; — ELO 1703, #41&lt;ul&gt;&lt;li&gt;APEX v1 Consulting: 61.7 (#13/39)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 59.4 (#18/39)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 65.1 (#24/39)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 54.2 (#30/39)&lt;/li&gt;&lt;li&gt;Epoch AI - Cursorbench: 49.7 (#55/67)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok Build 0.1&lt;/strong&gt; — ELO 1702, #42&lt;ul&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 97.8 (#2/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 95.5 (#6/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 97.8 (#6/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Plus&lt;/strong&gt; — ELO 1698, #43&lt;ul&gt;&lt;li&gt;OmniDocBench 1.5: 91.4 (#9/67)&lt;/li&gt;&lt;li&gt;CharXiv-R: 85.9 (#12/61)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 73.3 (#15/29)&lt;/li&gt;&lt;li&gt;NL2Repo: 41.1 (#18/25)&lt;/li&gt;&lt;li&gt;Design Arena (SVG): 1260.0 (#21/110)&lt;/li&gt;&lt;li&gt;Roboflow Playground Object Detection: 1200.0 (#29/48)&lt;/li&gt;&lt;li&gt;Roboflow Playground Overall: 1200.0 (#39/72)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 148.26 (#183/491)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash (0731)&lt;/strong&gt; — ELO 1697, #44&lt;ul&gt;&lt;li&gt;BenCzechMark: 81.36 (#3/74)&lt;/li&gt;&lt;li&gt;KernelBench Hub - Hard: 48.6 (#9/13)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 56.0 (#10/22)&lt;/li&gt;&lt;li&gt;WebDev Arena: 1576.54 (#11/111)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 154.43 (#106/491)&lt;/li&gt;&lt;li&gt;ARC-AGI-2: 2.08 (#154/214)&lt;/li&gt;&lt;li&gt;ARC-AGI-1: 11.83 (#191/212)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.5&lt;/strong&gt; — ELO 1693, #45&lt;ul&gt;&lt;li&gt;NarrativeWorldBench: 80.0 (#3/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5&lt;/strong&gt; — ELO 1692, #46&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 32.2 (#7/19)&lt;/li&gt;&lt;li&gt;Epoch AI - Enigma Eval: 10.47 (#14/46)&lt;/li&gt;&lt;li&gt;MMMU Benchmark: 74.4 (#24/189)&lt;/li&gt;&lt;li&gt;Epoch AI - Apex Agents: 18.3 (#37/61)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2&lt;/strong&gt; — ELO 1691, #48&lt;ul&gt;&lt;li&gt;OpenAI GPT-5.4 Launch - FrontierMath Tier 1-3: 40.7 (#3/3)&lt;/li&gt;&lt;li&gt;OpenAI GPT-5.4 Launch - FrontierMath Tier 4: 18.8 (#4/4)&lt;/li&gt;&lt;li&gt;LiveMathematicianBench: 26.3 (#15/19)&lt;/li&gt;&lt;li&gt;Epoch AI - Enigma Eval: 10.39 (#15/46)&lt;/li&gt;&lt;li&gt;Epoch AI - Apex Agents: 23.0 (#31/61)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.6&lt;/strong&gt; — ELO 1691, #49&lt;ul&gt;&lt;li&gt;Inverse Turing Bench: 57.45 (#12/29)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 57.06 (#14/53)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro&lt;/strong&gt; — ELO 1690, #51&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 36.9 (#5/19)&lt;/li&gt;&lt;li&gt;HANDBOOK.md Agents: 26.5 (#6/45)&lt;/li&gt;&lt;li&gt;ComplexConstraints: 42.0 (#12/57)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 60.9 (#13/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 58.3 (#21/39)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 64.6 (#27/39)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 54.8 (#28/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.5 (20251101)&lt;/strong&gt; — ELO 1688, #53&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 11.91 (#11/46)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1494.0 (#35/48)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; — ELO 1685, #54&lt;ul&gt;&lt;li&gt;APEX v1 Medicine (MD): 60.4 (#16/39)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 67.9 (#18/39)&lt;/li&gt;&lt;li&gt;Riemann-bench: 15.2 (#19/30)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 55.6 (#21/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 48.4 (#33/39)&lt;/li&gt;&lt;li&gt;HANDBOOK.md Agents: 2.3 (#42/45)&lt;/li&gt;&lt;li&gt;Chartography: 10.0 (#44/45)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.1&lt;/strong&gt; — ELO 1683, #57&lt;ul&gt;&lt;li&gt;Finance Agent v1.1: 57.66 (#12/53)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 397B A17B&lt;/strong&gt; — ELO 1681, #59&lt;ul&gt;&lt;li&gt;ABRA: 70.0 (#1/10)&lt;/li&gt;&lt;li&gt;Onyx Open LLM Leaderboard: 87.8 (#2/19)&lt;/li&gt;&lt;li&gt;DystopiaBench: 58.9 (#16/42)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.6&lt;/strong&gt; — ELO 1677, #61&lt;ul&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 98.9 (#2/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 97.8 (#3/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 96.6 (#3/14)&lt;/li&gt;&lt;li&gt;scBench: 50.4 (#10/17)&lt;/li&gt;&lt;li&gt;ComplexConstraints: 34.0 (#34/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3&lt;/strong&gt; — ELO 1676, #62&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 13.09 (#10/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M3&lt;/strong&gt; — ELO 1675, #65&lt;ul&gt;&lt;li&gt;KernelBench Hub - Mega: 2.63 (#8/9)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 61.3 (#14/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 59.8 (#19/39)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 64.9 (#26/39)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 53.1 (#28/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.3&lt;/strong&gt; — ELO 1673, #67&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 948.0 (#52/259)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1023.0 (#61/318)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash Lite&lt;/strong&gt; — ELO 1671, #68&lt;ul&gt;&lt;li&gt;Epoch AI - ECI: 145.11 (#238/491)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.5&lt;/strong&gt; — ELO 1669, #69&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 6.0 (#23/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1&lt;/strong&gt; — ELO 1668, #70&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 11.23 (#13/46)&lt;/li&gt;&lt;li&gt;Epoch AI - Apex Agents: 17.5 (#39/61)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Mini&lt;/strong&gt; — ELO 1668, #71&lt;ul&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 92.1 (#6/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 96.6 (#8/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 88.8 (#11/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash&lt;/strong&gt; — ELO 1668, #72&lt;ul&gt;&lt;li&gt;APEX v1 Consulting: 69.8 (#2/39)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 66.1 (#6/39)&lt;/li&gt;&lt;li&gt;ProphetArena: 0.9503 (#9/19)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 65.7 (#23/39)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 53.5 (#31/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.3&lt;/strong&gt; — ELO 1667, #75&lt;ul&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 97.8 (#1/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 97.8 (#5/14)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 93.3 (#7/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 (2025-04-16)&lt;/strong&gt; — ELO 1667, #76&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 27.0 (#13/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling Small&lt;/strong&gt; — ELO 1667, #77&lt;ul&gt;&lt;li&gt;Agent Arena - Bash Recovery: 10.73 (#15/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Tool Hallucination: -0.36 (#36/51)&lt;/li&gt;&lt;li&gt;Agent Arena: -6.82 (#40/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: -14.84 (#46/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: -12.81 (#47/51)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: -17.56 (#51/51)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Code): 1402.0 (#64/118)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Vision): 1206.0 (#70/147)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Text): 1405.0 (#136/394)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 150.17 (#140/491)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Glimmer 30B&lt;/strong&gt; — ELO 1667, #78&lt;ul&gt;&lt;li&gt;Riemann-bench: 13.6 (#22/30)&lt;/li&gt;&lt;li&gt;Chartography: 17.9 (#27/45)&lt;/li&gt;&lt;li&gt;Roboflow Playground Object Detection: 1189.0 (#35/48)&lt;/li&gt;&lt;li&gt;Gert Labs Rankings: 43.91 (#37/100)&lt;/li&gt;&lt;li&gt;HANDBOOK.md Agents: 3.5 (#39/45)&lt;/li&gt;&lt;li&gt;ComplexConstraints: 23.9 (#41/57)&lt;/li&gt;&lt;li&gt;Roboflow Playground Overall: 1189.0 (#53/72)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro&lt;/strong&gt; — ELO 1666, #79&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 32.1 (#8/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro (Preview 03-25)&lt;/strong&gt; — ELO 1661, #84&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 4.14 (#28/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 27B&lt;/strong&gt; — ELO 1657, #89&lt;ul&gt;&lt;li&gt;RealWorldQA: 84.1 (#4/14)&lt;/li&gt;&lt;li&gt;BenCzechMark: 70.57 (#16/74)&lt;/li&gt;&lt;li&gt;OmniDocBench 1.5: 89.4 (#23/67)&lt;/li&gt;&lt;li&gt;NL2Repo: 36.2 (#23/25)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 63.9 (#23/29)&lt;/li&gt;&lt;li&gt;CharXiv-R: 78.4 (#36/61)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.1&lt;/strong&gt; — ELO 1657, #90&lt;ul&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 28.84 (#183/603)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.1 (20250805)&lt;/strong&gt; — ELO 1657, #91&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 7.18 (#19/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro (Preview 05-06)&lt;/strong&gt; — ELO 1651, #95&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 2.36 (#34/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash Lite&lt;/strong&gt; — ELO 1650, #97&lt;ul&gt;&lt;li&gt;DystopiaBench: 72.9 (#35/42)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4&lt;/strong&gt; — ELO 1649, #98&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 5.57 (#25/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Mini&lt;/strong&gt; — ELO 1648, #99&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 8.19 (#17/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash Lite (Preview)&lt;/strong&gt; — ELO 1645, #102&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 3.04 (#32/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash (Preview 05-20)&lt;/strong&gt; — ELO 1645, #103&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 2.7 (#33/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 (2024-12-17)&lt;/strong&gt; — ELO 1641, #107&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 5.65 (#24/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2&lt;/strong&gt; — ELO 1640, #108&lt;ul&gt;&lt;li&gt;APEX v1 Consulting: 50.8 (#29/39)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 59.8 (#31/39)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 49.1 (#31/39)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 50.0 (#32/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4&lt;/strong&gt; — ELO 1640, #109&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 3.12 (#31/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3 Ultra&lt;/strong&gt; — ELO 1640, #111&lt;ul&gt;&lt;li&gt;APEX v1 Investment Banking: 54.9 (#24/39)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 64.0 (#29/39)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 54.8 (#29/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 50.8 (#30/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 27B&lt;/strong&gt; — ELO 1638, #116&lt;ul&gt;&lt;li&gt;HealthAdminBench: 13.3 (#9/11)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.7&lt;/strong&gt; — ELO 1638, #117&lt;ul&gt;&lt;li&gt;APEX v1 Big Law: 52.5 (#36/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 41.9 (#38/39)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 45.7 (#38/39)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 43.0 (#38/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2&lt;/strong&gt; — ELO 1635, #121&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 30.8 (#9/19)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 55.0 (#23/39)&lt;/li&gt;&lt;li&gt;HMMT 2025: 90.2 (#31/82)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 55.7 (#32/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 49.8 (#32/39)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 45.7 (#37/39)&lt;/li&gt;&lt;li&gt;Vals AI LegalBench: 76.08 (#104/139)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.7 Sonnet (20250219)&lt;/strong&gt; — ELO 1634, #124&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 2.26 (#35/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2 Exp&lt;/strong&gt; — ELO 1629, #131&lt;ul&gt;&lt;li&gt;CritPt: 1.4 (#83/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.1 Terminus&lt;/strong&gt; — ELO 1627, #134&lt;ul&gt;&lt;li&gt;Tau3 Banking: 21.03 (#69/176)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O4 Mini&lt;/strong&gt; — ELO 1625, #136&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 9.21 (#16/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1&lt;/strong&gt; — ELO 1622, #142&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 30.5 (#11/19)&lt;/li&gt;&lt;li&gt;Epoch AI - Enigma Eval: 2.17 (#36/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 31B&lt;/strong&gt; — ELO 1617, #152&lt;ul&gt;&lt;li&gt;APEX v1 Investment Banking: 49.1 (#30/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 47.6 (#34/39)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 52.9 (#35/39)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 42.8 (#39/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.5 (Preview)&lt;/strong&gt; — ELO 1609, #171&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 3.18 (#30/46)&lt;/li&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 13.61 (#338/603)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Nano&lt;/strong&gt; — ELO 1602, #175&lt;ul&gt;&lt;li&gt;Roboflow Playground Captioning: 1200.0 (#24/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Sonnet&lt;/strong&gt; — ELO 1601, #177&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 0.91 (#39/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o&lt;/strong&gt; — ELO 1592, #197&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 0.8 (#42/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-OSS-120B&lt;/strong&gt; — ELO 1590, #202&lt;ul&gt;&lt;li&gt;APEX v1 Medicine (MD): 47.2 (#35/39)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 43.8 (#36/39)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 52.0 (#37/39)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 42.7 (#37/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.0 Pro (Preview 02-05)&lt;/strong&gt; — ELO 1588, #206&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 0.69 (#43/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 Mini&lt;/strong&gt; — ELO 1587, #207&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 22.9 (#18/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 12B&lt;/strong&gt; — ELO 1587, #209&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#177/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 3&lt;/strong&gt; — ELO 1586, #210&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 33.0 (#6/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.6V&lt;/strong&gt; — ELO 1586, #211&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#171/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 4 Maverick&lt;/strong&gt; — ELO 1583, #216&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 29.7 (#12/19)&lt;/li&gt;&lt;li&gt;Epoch AI - Enigma Eval: 0.58 (#45/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.0 Flash&lt;/strong&gt; — ELO 1583, #217&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 1.1 (#38/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1&lt;/strong&gt; — ELO 1580, #227&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 30.6 (#10/19)&lt;/li&gt;&lt;li&gt;IneqMath: 5.0 (#23/42)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 26B A4B&lt;/strong&gt; — ELO 1580, #228&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#176/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.0 Flash (001)&lt;/strong&gt; — ELO 1579, #230&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 0.63 (#44/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Nano&lt;/strong&gt; — ELO 1577, #238&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#165/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash Lite&lt;/strong&gt; — ELO 1569, #249&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#188/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small 4&lt;/strong&gt; — ELO 1566, #255&lt;ul&gt;&lt;li&gt;CritPt: 0.3 (#128/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.5V&lt;/strong&gt; — ELO 1550, #291&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#172/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.3 70B Instruct&lt;/strong&gt; — ELO 1543, #307&lt;ul&gt;&lt;li&gt;LiveMathematicianBench: 27.0 (#14/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.2 90B Vision Instruct&lt;/strong&gt; — ELO 1542, #309&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 0.38 (#46/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V2.5&lt;/strong&gt; — ELO 1536, #328&lt;ul&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 6.55 (#478/603)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 42.32 (#482/584)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-OSS-20B&lt;/strong&gt; — ELO 1533, #337&lt;ul&gt;&lt;li&gt;Epoch AI - ECI: 136.65 (#345/491)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Opus&lt;/strong&gt; — ELO 1525, #355&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 0.82 (#41/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EXAONE 4.0 32B&lt;/strong&gt; — ELO 1515, #369&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#190/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LFM2 24B A2B&lt;/strong&gt; — ELO 1451, #489&lt;ul&gt;&lt;li&gt;BenCzechMark: 3.72 (#73/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E2B&lt;/strong&gt; — ELO 1433, #516&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#175/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLaMA-65B&lt;/strong&gt; — ELO 1417, #546&lt;ul&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 1.71 (#584/603)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek Coder V2&lt;/strong&gt; — ELO 1538&lt;ul&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 4.74 (#511/603)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V2 Chat&lt;/strong&gt; — ELO 1539&lt;ul&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 3.27 (#543/603)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro Preview&lt;/strong&gt; — ELO 1683&lt;ul&gt;&lt;li&gt;MineBench: 1394.44 (#28/61)&lt;/li&gt;&lt;li&gt;HANDBOOK.md Agents: 9.2 (#29/45)&lt;/li&gt;&lt;li&gt;ComplexConstraints: 28.0 (#40/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek-V4-Flash-Vision-Exp&lt;/strong&gt; — ELO 1752&lt;ul&gt;&lt;li&gt;LLM Stats (ZEROBench): 35.0 (#2/10)&lt;/li&gt;&lt;li&gt;LLM Stats (NL2Repo): 57.7 (#3/18)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSWE): 59.3 (#6/12)&lt;/li&gt;&lt;li&gt;LLM Stats (AutomationBench): 25.7 (#7/13)&lt;/li&gt;&lt;li&gt;LLM Stats (Agents' Last Exam): 27.3 (#8/11)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 83.9 (#10/29)&lt;/li&gt;&lt;li&gt;LLM Stats Score: 48.67 (#15/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Instant&lt;/strong&gt; — ELO 1600&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 1.94 (#37/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2 ChatGPT&lt;/strong&gt; — ELO 1692&lt;ul&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 842.0 (#64/259)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 835.0 (#96/318)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Instant&lt;/strong&gt; — ELO 1666&lt;ul&gt;&lt;li&gt;Epoch AI - ECI: 143.49 (#263/491)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Deep Think&lt;/strong&gt; — ELO 1761&lt;ul&gt;&lt;li&gt;AA CritPt: 25.71 (#14/490)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LFM2.5-2.6B&lt;/strong&gt; — ELO 1515&lt;ul&gt;&lt;li&gt;AA Omniscience: -10.95 (#128/487)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 7.22 (#134/176)&lt;/li&gt;&lt;li&gt;AA GDPval: 251.28 (#185/210)&lt;/li&gt;&lt;li&gt;AA Humanity's Last Exam: 6.21 (#334/575)&lt;/li&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 10.99 (#380/603)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 55.76 (#403/584)&lt;/li&gt;&lt;li&gt;AA Long Context Reasoning: 5.33 (#433/508)&lt;/li&gt;&lt;li&gt;AA Omniscience - Science, Engineering &amp; Mathematics: 12.2 (#437/486)&lt;/li&gt;&lt;li&gt;AA CritPt: 0.0 (#466/490)&lt;/li&gt;&lt;li&gt;AA Omniscience - Business: 3.8 (#479/487)&lt;/li&gt;&lt;li&gt;...and 6 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna M.1&lt;/strong&gt; — ELO 1568&lt;ul&gt;&lt;li&gt;Vals AI MedScribe: 65.91 (#81/87)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral 8B&lt;/strong&gt; — ELO 1448&lt;ul&gt;&lt;li&gt;LM Market Cap LMC Score: 37.4 (#395/428)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Pro&lt;/strong&gt; — ELO 1625&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 6.14 (#22/46)&lt;/li&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 19.12 (#270/603)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Pixtral Large&lt;/strong&gt; — ELO 1539&lt;ul&gt;&lt;li&gt;Epoch AI - Enigma Eval: 0.84 (#40/46)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5&lt;/strong&gt; — ELO 1629&lt;ul&gt;&lt;li&gt;APEX v1 Consulting: 50.5 (#31/39)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 54.6 (#33/39)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 48.2 (#33/39)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 47.8 (#34/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 Max&lt;/strong&gt; — ELO 1715&lt;ul&gt;&lt;li&gt;DystopiaBench: 71.1 (#31/42)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Flash&lt;/strong&gt; — ELO 1638&lt;ul&gt;&lt;li&gt;Roboflow Playground Open Prompt: 1200.0 (#20/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (126)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on APEX v1: 66.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on APEX v1 Big Law: 69.3 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on APEX v1 Consulting: 66.6 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on APEX v1 Investment Banking: 66.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on APEX v1 Medicine (MD): 61.4 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on ArxivMath: 78.6 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on CyberGym: 83.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Epoch AI - Cursorbench: 65.2 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Epoch AI - Enigma Eval: 39.28 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on FrontierCode: 46.3 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on FutureEval: 13.23 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 98.9 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 68.3 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 95.3 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Agents' Last Exam: 27.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Epoch AI - Cursorbench: 64.3 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveMathematicianBench: 45.1 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 66.7 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 68.3 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 96.4 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI LegalBench: 86.97 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI MMMU: 89.88 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI MedCode: 63.57 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI MedScribe: 90.98 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI SAGE: 49.43 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on AA CritPt: 30.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on Epoch AI - Enigma Eval: 23.82 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on OpenAI GPT-5.4 Launch - FrontierMath Tier 1-3: 50.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on OpenAI GPT-5.5 Launch - FrontierMath Tier 1-3: 50.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on AA CritPt: 30.57 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on OpenAI GPT-5.5 Launch - FrontierMath Tier 1-3: 52.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on OpenAI GPT-5.5 Launch - FrontierMath Tier 4: 39.6 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CyberGym: 83.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (3D): 1438.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (Data Viz): 1338.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (Game Dev): 1414.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (UI Components): 1387.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Apex Agents: 37.7 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Cursorbench: 64.5 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Enigma Eval: 37.12 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ParseBench: 62.12 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Roboflow Playground Open Prompt: 1200.0 (#29)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 92.2 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 82.9 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 99.5 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Toolathlon: 74.9 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Pedagogy: 90.77 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Pedagogy - Maths: 92.06 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Pedagogy - Primary: 94.84 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Pedagogy - Science: 92.9 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Pedagogy - Secondary: 89.62 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Pedagogy - Social studies: 87.27 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Pedagogy - Technology: 86.79 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education SEND: 87.16 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Reasoning - match (process): 88.9 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Reasoning - odd one out: 84.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI for Education Visual Reasoning - pattern completion (2d): 79.5 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ARC-AGI-1: 95.5 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ARC-AGI-2: 84.58 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agents on Rails: 71.4 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Arena AI Code: 1587.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on BioMysteryBench Human-Difficult: 43.5 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on BioMysteryBench Human-Solvable: 87.1 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on CharXiv-R: 84.5 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Chartography: 43.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ComplexConstraints: 42.4 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Deep20Bench: 14.03 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Design Arena (3D): 1358.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Design Arena (Data Viz): 1353.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Design Arena (UI Components): 1319.0 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Epoch AI - Cursorbench: 61.6 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Epoch AI - ECI: 156.85 (#49)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Epoch AI - Proofbench: 58.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on FrontierCode: 43.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Gert Labs Rankings: 65.05 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on HANDBOOK.md Agents: 11.9 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Icelandic LLM - ARC-Challenge-IS: 95.22 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Icelandic LLM - Belebele-IS: 94.56 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Icelandic LLM - GED: 82.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Icelandic LLM - Inflection: 97.33 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Icelandic LLM - WikiQA-IS: 66.82 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on InfoOps Bench: 48.5 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Kaggle FACTS Parametric: 78.72 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LMArena Text Arena: 1489.87 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LMArena WebDev Arena: 1587.86 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on MMOU: 82.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Riemann-bench: 39.2 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Roboflow Playground OCR: 1186.0 (#45)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Roboflow Playground Object Detection: 1218.0 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Roboflow Playground Overall: 1202.0 (#35)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Code Migration: 34.8 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI GPQA: 93.94 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI LegalBench: 87.26 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI LiveCodeBench: 88.65 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI MMLU-Pro: 90.12 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI MMMU: 88.96 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI MedCode: 53.39 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI MedScribe: 83.94 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI MortgageTax: 66.65 (#32)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI ProgramBench: 68.66 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI SAGE: 49.23 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI SWE-bench Verified: 80.8 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI SkillsBench: 65.89 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI TaxEval v2: 74.73 (#29)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on WebDev Arena: 1587.48 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Visual Reasoning: 76.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Visual Reasoning - match (figure): 63.9 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Visual Reasoning - match (process): 75.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Visual Reasoning - odd one out: 79.2 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Visual Reasoning - pattern completion (2d): 71.2 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Visual Reasoning - pattern completion (linear): 82.1 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AI for Education Visual Reasoning - reasoning by analogy: 83.7 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on APEX v1: 68.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on APEX v1 Big Law: 73.2 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on APEX v1 Consulting: 69.7 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on APEX v1 Investment Banking: 66.4 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on APEX v1 Medicine (MD): 64.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Benchmarks.bio - BioSecBench-Refusal: 8.6 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Benchmarks.bio - BioSecBench-Surveillance: 48.3 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on CyberGym: 80.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Cursorbench: 60.8 (#28)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on NL2Repo: 58.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 93.3 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 65.1 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 93.3 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Toolathlon: 76.5 (#2)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (38)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Multi-SWE-Bench (c)&lt;/strong&gt;: CodeArts Agent + CodeArts-GLM-5.1 (54.33) beat RepoRepair + Claude-4-Sonnet by 41.72&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Lean AI Formalization Leaderboard&lt;/strong&gt;: Humanifa + GPT 5.6 sol (183.0) beat Seed Prover (ByteDance) by 28.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Multi-SWE-Bench (c++)&lt;/strong&gt;: CodeArts Agent + CodeArts-GLM-5.1 (47.29) beat InfCode + GPT5(Sep) by 21.71&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Video Edit)&lt;/strong&gt;: dreamina-seedance-2.5-720p (1411.0) beat minimax-h3 by 21.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KernelBench Hub - Hard&lt;/strong&gt;: Qwen 3.8 Max (69.26) beat Claude Fable 5 by 14.05&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SpreadsheetBench v2&lt;/strong&gt;: arito (45.46) beat Claude Opus 4.6 by 10.57&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SWE-PolyBench Verified (TypeScript)&lt;/strong&gt;: HMigBot (53.0) beat Atlassian Rovo Dev (2025-12-08) by 10.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;APEX v1 Consulting&lt;/strong&gt;: GPT-5.6 Terra (76.2) beat GPT-5.2 Codex by 9.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MobileWorld - GUI Only&lt;/strong&gt;: Qwen-UI-Agent (82.1) beat Kimi K3 by 7.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LVBench&lt;/strong&gt;: Gemini 3.7 Flash (85.4) beat Seed 2.1 Pro by 7.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SWE-PolyBench Verified (Python)&lt;/strong&gt;: HMigBot (61.95) beat Atlassian Rovo Dev (2025-12-08) by 7.08&lt;/li&gt;&lt;li&gt;&lt;strong&gt;APEX v1 Investment Banking&lt;/strong&gt;: GPT-5.6 Terra (71.8) beat GPT-5.3 Codex by 6.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - reasoning by analogy&lt;/strong&gt;: Gemini 3.7 Flash (94.4) beat Gemini 3.5 Flash by 5.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MRCR-v2 128k&lt;/strong&gt;: Gemini 3.7 Flash (97.0) beat Gemini 3.6 Flash by 5.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench - Completeness&lt;/strong&gt;: metor.com (86.22) beat Troml by 4.38&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMEB Leaderboard&lt;/strong&gt;: Ovis-Omni-Embedding-v0.5-3B (56.95) beat Tianmu-Emb-Uni by 4.12&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kaggle FACTS (Google)&lt;/strong&gt;: Gemini 3.7 Flash (71.27) beat Gemini 3.1 Pro (Preview) by 4.02&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning&lt;/strong&gt;: Gemini 3.7 Flash (89.9) beat Gemini 3.5 Flash by 3.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BioMysteryBench Human-Solvable&lt;/strong&gt;: Claude Sonnet 5 (87.5) beat Claude Mythos 5 by 3.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench&lt;/strong&gt;: metor.com (80.34) beat Troml by 3.55&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - pattern completion (linear)&lt;/strong&gt;: Gemini 3.7 Flash (95.7) beat GPT-5.6 Sol by 3.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BioMysteryBench Human-Difficult&lt;/strong&gt;: GPT-5.6 Terra (49.4) beat Claude Mythos 5 by 3.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kaggle FACTS Multimodal&lt;/strong&gt;: Gemini 3.7 Flash (49.83) beat Gemini 3.6 Flash by 2.62&lt;/li&gt;&lt;li&gt;&lt;strong&gt;APEX v1&lt;/strong&gt;: GPT-5.6 Terra (Max) (69.5) beat GPT-5.4 (High) by 2.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - match (figure)&lt;/strong&gt;: Gemini 3.7 Flash (87.4) beat Gemini 3.5 Flash by 2.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (UI Components)&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (1387.0) beat Kimi K3 by 2.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Pedagogy - Science&lt;/strong&gt;: Grok 4.6 (96.72) beat Qwen 3.5 Plus by 1.64&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Humanity's Last Exam (Self-Reported, With Tools)&lt;/strong&gt;: Ornith-1.5-397B (56.1) beat GLM-5.2 by 1.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Epoch AI - ECI&lt;/strong&gt;: Claude Fable 5 (High) (162.49) beat GPT-5.6 Sol (Medium) by 0.84&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CyberGym&lt;/strong&gt;: GLM-5.3 (84.5) beat Claude Mythos 5 by 0.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WebVoyager&lt;/strong&gt;: browser-control (Fable 5) (99.19) beat Alumnium by 0.69&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KernelBench Hub - Mega&lt;/strong&gt;: Claude Fable 5 (24.61) beat Claude Opus 5 by 0.32&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SpreadsheetBench&lt;/strong&gt;: JT AlphaData (98.5) beat Qingqiu Agent by 0.25&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Icelandic LLM - WinoGrande-IS&lt;/strong&gt;: Gemini 3.7 Flash (96.32) beat Gemini 3.1 Pro (Preview) by 0.18&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Icelandic LLM Leaderboard - Average&lt;/strong&gt;: Gemini 3.7 Flash (88.71) beat Gemini 3.1 Pro (Preview) by 0.17&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BRIDGE Medical Leaderboard - Few-Shot&lt;/strong&gt;: Qwen 3.8 27B (Non-reasoning) (55.67) beat Gemini 1.5 Pro (002) by 0.16&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Pedagogy - Secondary&lt;/strong&gt;: Grok 4.6 (91.19) beat GPT-5.5 by 0.15&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProphetArena&lt;/strong&gt;: Gemini 3.7 Flash (0.9687) beat Gemini 3.6 Flash by 0.01&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-23

=== DAILY ===
NEW SCORES FROM TOP-10 MODELS (6)
  - Claude Opus 5 on Agents' Last Exam: 27.0 Pass Rate (%) (#7/25)
  - Gemini 3.7 Flash on Arena AI Code: 1587.0 Arena ELO (self-reported) (#10/48)
  - Gemini 3.7 Flash on LMArena Text Arena: 1489.87 Arena rating (sel</summary></entry><entry><title>The Aggregate Digest — 2026-08-22</title><id>https://theaggregate.ai/digest/2026-08-22</id><updated>2026-08-22T06:30:27.535616+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;DeepSeek-V4-Flash-Vision-Exp&lt;/strong&gt; — ELO 1754&lt;ul&gt;&lt;li&gt;LLM Stats (ZEROBench): 35.0 (#2/10)&lt;/li&gt;&lt;li&gt;LLM Stats (NL2Repo): 57.7 (#3/18)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSWE): 59.3 (#6/12)&lt;/li&gt;&lt;li&gt;LLM Stats (AutomationBench): 25.7 (#7/13)&lt;/li&gt;&lt;li&gt;LLM2014 Logic 2026-08: 58.1 (#8/44)&lt;/li&gt;&lt;li&gt;LLM Stats (Agents' Last Exam): 27.3 (#8/11)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 83.9 (#10/29)&lt;/li&gt;&lt;li&gt;LLM Stats Score: 48.67 (#15/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (16)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on ArxivMath: 78.6 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on CyberGym: 83.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on FrontierCode: 46.3 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Benchmarks.bio - BioSecBench-Refusal: 29.4 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI MedCode: 63.57 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI MedScribe: 90.98 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CyberGym: 83.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Toolathlon: 74.9 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on BioMysteryBench Human-Difficult: 43.5 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on BioMysteryBench Human-Solvable: 87.1 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on CharXiv-R: 84.5 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on FrontierCode: 43.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Roboflow Playground OCR: 1186.0 (#45)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on CyberGym: 80.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on NL2Repo: 58.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Toolathlon: 76.5 (#2)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (5)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LVBench&lt;/strong&gt;: Gemini 3.7 Flash (85.4) beat Seed 2.1 Pro by 7.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MRCR-v2 128k&lt;/strong&gt;: Gemini 3.7 Flash (97.0) beat Gemini 3.6 Flash by 5.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BioMysteryBench Human-Solvable&lt;/strong&gt;: Claude Sonnet 5 (87.5) beat Claude Mythos 5 by 3.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BioMysteryBench Human-Difficult&lt;/strong&gt;: GPT-5.6 Terra (49.4) beat Claude Mythos 5 by 3.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CyberGym&lt;/strong&gt;: GLM-5.3 (84.5) beat Claude Mythos 5 by 0.7&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-22

=== DAILY ===
NEW MODELS (1)
  - DeepSeek-V4-Flash-Vision-Exp — ELO 1754
      LLM Stats (ZEROBench): 35.0 (#2/10)
      LLM Stats (NL2Repo): 57.7 (#3/18)
      LLM Stats (DeepSWE): 59.3 (#6/12)
      LLM Stats (AutomationBench): 25.7 (#7/13)
      LLM2014 Logic 20</summary></entry><entry><title>The Aggregate Digest — 2026-08-21</title><id>https://theaggregate.ai/digest/2026-08-21</id><updated>2026-08-21T11:50:31.255079+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Frontier&lt;/h2&gt;
&lt;ul&gt;&lt;li&gt;Best available model: Claude Opus 5 (1792) takes the crown from Gemini 3.7 Flash (1784)&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;Top-10 New Scores (32)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA GDPval: 1844.67 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA Omniscience - Business: 53.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA Omniscience - Health: 52.42 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 58.6 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA Omniscience - Law: 58.4 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 57.52 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 86.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA-Briefcase: 57.98 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AA-Omniscience Accuracy: 60.87 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA GDPval: 1722.96 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Business: 49.6 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Health: 52.4 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 57.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Law: 55.9 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 55.7 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 85.5 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA-Briefcase: 41.85 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AA-Omniscience Accuracy: 59.4 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Roboflow Playground Open Prompt: 1200.0 (#29)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA GDPval: 1531.55 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Business: 45.6 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Health: 44.7 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 55.2 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Law: 62.1 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 52.0 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 72.3 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA-Briefcase: 36.36 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA-Omniscience Accuracy: 55.32 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ARC-AGI-1: 95.5 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ARC-AGI-2: 84.58 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Roboflow Playground Object Detection: 1218.0 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Roboflow Playground Overall: 1218.0 (#16)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (10)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;AA GDPval&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Max Effort) (1844.67) beat Qwen3.8 2.4T A95B by 124.28&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE)&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (91.1) beat Kimi K3 (Max) by 18.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Business&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (57.4) beat Gemini 3 Pro (Preview) (High) by 10.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA-Omniscience Accuracy&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (65.35) beat Gemini 3 Pro (Preview) (High) by 9.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Science, Engineering &amp; Mathematics&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (61.28) beat Gemini 3 Pro (Preview) (High) by 8.98&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Humanities &amp; Social Sciences&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (64.3) beat Gemini 3 Pro (Preview) (High) by 8.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA-Briefcase&lt;/strong&gt;: Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) (57.98) beat Kimi K3 (Max) by 7.01&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Health&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (53.72) beat Gemini 3 Pro (Preview) (High) by 6.42&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMEB Leaderboard&lt;/strong&gt;: Ovis-Omni-Embedding-v0.5-3B (57.25) beat Tianmu-Emb-Uni by 4.42&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Law&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (66.2) beat Gemini 3 Pro (Preview) (High) by 1.1&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-21

=== FRONTIER ===
  - Best available model: Claude Opus 5 (1792) takes the crown from Gemini 3.7 Flash (1784)

=== DAILY ===
NEW SCORES FROM TOP-10 MODELS (32)
  - Claude Opus 5 on AA GDPval: 1844.67 ELO (#1/204)
  - Claude Opus 5 on AA Omniscience - Business: 53.0 </summary></entry><entry><title>The Aggregate Digest — 2026-08-20</title><id>https://theaggregate.ai/digest/2026-08-20</id><updated>2026-08-20T05:51:23.006145+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Frontier&lt;/h2&gt;
&lt;ul&gt;&lt;li&gt;Best available model: GLM-5.3 enters at #11 (1753 ELO) on 43 benchmarks&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SecIT Bench (Pydantic AI)&lt;/strong&gt; (Accuracy (%)): leader Grok 4.6 (80.65), 14 models&lt;br&gt;&lt;span&gt;Cribl&amp;#x27;s benchmark for IT and security operations agents, run under a plain Pydantic AI harness. Thirty telemetry scenarios across intrusion and breach, covert egress, service errors and performance degradation are each rolled out three times; an incomplete answer scores zero, and the reported figure is the mean scenario accuracy.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SecIT Bench (Claude Code)&lt;/strong&gt; (Accuracy (%)): leader Claude Opus 5 (78.64), 3 models&lt;br&gt;&lt;span&gt;The SecIT Bench scenario set run inside the Claude Code agent product rather than a plain model harness. Scored identically to the Pydantic AI board, and kept separate because the scaffold is part of what is being measured: the same model moves by up to three points between harnesses.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SecIT Bench (Codex)&lt;/strong&gt; (Accuracy (%)): leader GPT-5.6 Terra (71.88), 3 models&lt;br&gt;&lt;span&gt;The SecIT Bench scenario set run inside the Codex agent product rather than a plain model harness. Scored identically to the Pydantic AI board, and kept separate because the scaffold is part of what is being measured: GPT-5.6 Terra scores 71.9 here against 69.4 under the plain harness.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (21)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on APEX v1: 66.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on APEX v1 Big Law: 69.3 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on APEX v1 Consulting: 66.6 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on APEX v1 Investment Banking: 66.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on APEX v1 Medicine (MD): 61.4 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on FutureEval: 13.23 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LiveMathematicianBench: 45.1 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI LegalBench: 86.97 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI MMMU: 89.88 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI SAGE: 49.43 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Icelandic LLM - ARC-Challenge-IS: 95.22 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Icelandic LLM - Belebele-IS: 94.56 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Icelandic LLM - GED: 82.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Icelandic LLM - Inflection: 97.33 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Icelandic LLM - WikiQA-IS: 66.82 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on InfoOps Bench: 48.5 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on APEX v1: 68.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on APEX v1 Big Law: 73.2 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on APEX v1 Consulting: 69.7 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on APEX v1 Investment Banking: 66.4 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on APEX v1 Medicine (MD): 64.3 (#2)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Multi-SWE-Bench (c)&lt;/strong&gt;: CodeArts Agent + CodeArts-GLM-5.1 (54.33) beat RepoRepair + Claude-4-Sonnet by 41.72&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Multi-SWE-Bench (c++)&lt;/strong&gt;: CodeArts Agent + CodeArts-GLM-5.1 (47.29) beat InfCode + GPT5(Sep) by 21.71&lt;/li&gt;&lt;li&gt;&lt;strong&gt;APEX v1 Consulting&lt;/strong&gt;: GPT-5.6 Terra (76.2) beat GPT-5.2 Codex by 9.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;APEX v1 Investment Banking&lt;/strong&gt;: GPT-5.6 Terra (71.8) beat GPT-5.3 Codex by 6.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;APEX v1&lt;/strong&gt;: GPT-5.6 Terra (Max) (69.5) beat GPT-5.4 (High) by 2.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Humanity's Last Exam (Self-Reported, With Tools)&lt;/strong&gt;: Ornith-1.5-397B (56.1) beat GLM-5.2 by 1.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Icelandic LLM - WinoGrande-IS&lt;/strong&gt;: Gemini 3.7 Flash (96.32) beat Gemini 3.1 Pro (Preview) by 0.18&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Icelandic LLM Leaderboard - Average&lt;/strong&gt;: Gemini 3.7 Flash (88.71) beat Gemini 3.1 Pro (Preview) by 0.17&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BRIDGE Medical Leaderboard - Few-Shot&lt;/strong&gt;: Qwen3.8-27B-Non-Thinking (55.67) beat Gemini 1.5 Pro (002) by 0.16&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-20

=== FRONTIER ===
  - Best available model: GLM-5.3 enters at #11 (1753 ELO) on 43 benchmarks

=== DAILY ===
NEW BENCHMARKS (3)
  - SecIT Bench (Pydantic AI) (Accuracy (%)): leader Grok 4.6 (80.65), 14 models
      Cribl's benchmark for IT and security operations ag</summary></entry><entry><title>The Aggregate Digest — 2026-08-19</title><id>https://theaggregate.ai/digest/2026-08-19</id><updated>2026-08-19T08:54:18.919667+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;BenchBench-Protocol&lt;/strong&gt; (Normalized Rubric Score (%)): leader Claude Opus 5 (59.2), 9 models&lt;br&gt;&lt;span&gt;Benchling&amp;#x27;s wet-lab protocol-modification benchmark: 149 expert-reviewed tasks derived from the differences between a published protocol and the version a scientist actually ran, across 96 source protocols in nine domains of wet-lab biology. Responses are graded against weighted rubrics recovered from the real modification, so the score measures whether a model reasons about prior choices and downstream steps rather than reciting protocol text.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Guesswork 2026-08&lt;/strong&gt; (MAE (z-score units)): leader Llama 3.1 8B Instruct (1.9018), 31 models&lt;br&gt;&lt;span&gt;Guesswork standings for 2026-08: each contestant predicts newly scraped (model, benchmark) scores from day-before information only, scored as mean absolute error in z-score units — lower is better. The Aggregate&amp;#x27;s own row is excluded so the site&amp;#x27;s predictor cannot feed itself a score.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Guesswork 2026-07&lt;/strong&gt; (MAE (z-score units)): leader Gemma 3 4B (IT) (6.881), 37 models&lt;br&gt;&lt;span&gt;Guesswork standings for 2026-07: each contestant predicts newly scraped (model, benchmark) scores from day-before information only, scored as mean absolute error in z-score units — lower is better. The Aggregate&amp;#x27;s own row is excluded so the site&amp;#x27;s predictor cannot feed itself a score.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Guesswork 2026-06&lt;/strong&gt; (MAE (z-score units)): leader Llama 3.1 8B Instruct (2.7281), 19 models&lt;br&gt;&lt;span&gt;Guesswork standings for 2026-06: each contestant predicts newly scraped (model, benchmark) scores from day-before information only, scored as mean absolute error in z-score units — lower is better. June was the immature-matrix month, when several LLMs beat the aggregate.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (33)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Epoch AI - Cursorbench: 65.2 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 98.9 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 68.3 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 95.3 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Epoch AI - Cursorbench: 64.3 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 66.7 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 68.3 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 96.4 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on AA CritPt: 19.14 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on AA GPQA Diamond: 91.72 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on AA Humanity's Last Exam: 42.26 (#28)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on AA Long Context Reasoning: 76.33 (#40)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on AA Omniscience: 14.3 (#36)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on AA SciCode: 56.48 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on Artificial Analysis Intelligence Index: 59.51 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LM Market Cap LMC Score: 82.7 (#75)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on Tau3 Banking: 50.31 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on AA CritPt: 30.57 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Apex Agents: 37.7 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Cursorbench: 64.5 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 92.2 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 82.9 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 99.5 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Deep Think&lt;/strong&gt; on AA CritPt: 25.71 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Chartography: 43.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ComplexConstraints: 42.4 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Epoch AI - Cursorbench: 61.6 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Epoch AI - ECI: 156.36 (#55)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Gert Labs Rankings: 65.17 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on HANDBOOK.md Agents: 11.9 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on MMOU: 82.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Riemann-bench: 39.2 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on WebDev Arena: 1587.48 (#9)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SWE-PolyBench Verified (TypeScript)&lt;/strong&gt;: HMigBot (53.0) beat Atlassian Rovo Dev (2025-12-08) by 10.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SWE-PolyBench Verified (Python)&lt;/strong&gt;: HMigBot (61.95) beat Atlassian Rovo Dev (2025-12-08) by 7.08&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench - Completeness&lt;/strong&gt;: metor.com (86.22) beat Troml by 4.38&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kaggle FACTS (Google)&lt;/strong&gt;: Gemini 3.7 Flash (71.27) beat Gemini 3.1 Pro (Preview) by 4.02&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseRAG Bench&lt;/strong&gt;: metor.com (80.34) beat Troml by 3.55&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Confirmed Success&lt;/strong&gt;: Inkling Small (18.91) beat Claude Opus 5 (Max) by 0.95&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-19

=== DAILY ===
NEW BENCHMARKS (4)
  - BenchBench-Protocol (Normalized Rubric Score (%)): leader Claude Opus 5 (59.2), 9 models
      Benchling's wet-lab protocol-modification benchmark: 149 expert-reviewed tasks derived from the differences between a published proto</summary></entry><entry><title>The Aggregate Digest — 2026-08-18</title><id>https://theaggregate.ai/digest/2026-08-18</id><updated>2026-08-18T05:14:30.331602+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Z.ai GLM-5.3 Launch - Terminal Bench 3.0&lt;/strong&gt; (Accuracy (%)): leader GPT-5.6 Sol (34.6), 6 models&lt;br&gt;&lt;span&gt;Terminal-Bench 3.0 terminal-agent tasks as reported in Z.ai&amp;#x27;s GLM-5.3 launch table, using Claude Code with maximum reasoning effort, isolated task containers, official verifiers, and avg@3 over three rollouts; Z.ai-run frontier comparison.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Z.ai GLM-5.3 Launch - SWE-Marathon v1.1&lt;/strong&gt; (Pass@1 (%)): leader Claude Opus 4.8 (48.8), 6 models&lt;br&gt;&lt;span&gt;SWE-Marathon v1.1 ultra-long-horizon software-engineering tasks as reported in Z.ai&amp;#x27;s GLM-5.3 launch table; Z.ai-run frontier comparison using Claude Code at maximum effort.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Z.ai GLM-5.3 Launch - ExploitGym (2h)&lt;/strong&gt; (Successful Intended Exploits (#)): leader GPT-5.6 Sol (216.0), 7 models&lt;br&gt;&lt;span&gt;ExploitGym real-world exploit-generation tasks completed under a two-hour throughput-normalized budget, as reported in Z.ai&amp;#x27;s GLM-5.3 launch table; Z.ai-run frontier comparison.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Z.ai GLM-5.3 Launch - ExploitGym (6h)&lt;/strong&gt; (Successful Intended Exploits (#)): leader GPT-5.6 Sol (293.0), 7 models&lt;br&gt;&lt;span&gt;ExploitGym real-world exploit-generation tasks completed under a six-hour throughput-normalized budget, as reported in Z.ai&amp;#x27;s GLM-5.3 launch table; Z.ai-run frontier comparison.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Z.ai GLM-5.3 Launch - HLE with Tools&lt;/strong&gt; (Accuracy (%)): leader GPT-5.6 Sol (64.5), 8 models&lt;br&gt;&lt;span&gt;Humanity&amp;#x27;s Last Exam with tool use as reported in Z.ai&amp;#x27;s GLM-5.3 launch table; Z.ai-run comparison across eight recent frontier models.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Z.ai GLM-5.3 Launch - GDPval-AA v2&lt;/strong&gt; (ELO): leader GLM-5.3 (1769.0), 8 models&lt;br&gt;&lt;span&gt;Artificial Analysis GDPval-AA v2 evaluation of economically valuable professional knowledge work, reported as Elo in Z.ai&amp;#x27;s GLM-5.3 launch table; Artificial Analysis runs compared by Z.ai.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (8)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Epoch AI - Enigma Eval: 39.28 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on Agents on Rails: 79.4 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on Epoch AI - Enigma Eval: 23.82 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Enigma Eval: 37.12 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agents on Rails: 71.4 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Deep20Bench: 14.03 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Design Arena (Data Viz): 1358.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Kaggle FACTS Parametric: 78.72 (#2)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (11)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Video Edit)&lt;/strong&gt;: dreamina-seedance-2.5-720p (1411.0) beat minimax-h3 by 21.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SpreadsheetBench v2&lt;/strong&gt;: arito (45.46) beat Claude Opus 4.6 by 10.57&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - reasoning by analogy&lt;/strong&gt;: Gemini-3.7 Flash (94.4) beat Gemini 3.5 Flash by 5.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning&lt;/strong&gt;: Gemini-3.7 Flash (89.9) beat Gemini 3.5 Flash by 3.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - pattern completion (linear)&lt;/strong&gt;: Gemini-3.7 Flash (95.7) beat GPT-5.6 Sol by 3.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kaggle FACTS Multimodal&lt;/strong&gt;: Gemini 3.7 Flash (49.83) beat Gemini 3.6 Flash by 2.62&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Visual Reasoning - match (figure)&lt;/strong&gt;: Gemini-3.7 Flash (87.4) beat Gemini 3.5 Flash by 2.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Pedagogy - Science&lt;/strong&gt;: Grok 4.6 (96.72) beat Qwen 3.5 Plus by 1.64&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SpreadsheetBench&lt;/strong&gt;: JT AlphaData (98.5) beat Qingqiu Agent by 0.25&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AI for Education Pedagogy - Secondary&lt;/strong&gt;: Grok 4.6 (91.19) beat GPT-5.5 by 0.15&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProphetArena&lt;/strong&gt;: Gemini 3.7 Flash (0.9799) beat Gemini 3.6 Flash by 0.02&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-18

=== DAILY ===
NEW BENCHMARKS (6)
  - Z.ai GLM-5.3 Launch - Terminal Bench 3.0 (Accuracy (%)): leader GPT-5.6 Sol (34.6), 6 models
      Terminal-Bench 3.0 terminal-agent tasks as reported in Z.ai's GLM-5.3 launch table, using Claude Code with maximum reasoning effo</summary></entry><entry><title>The Aggregate Digest — 2026-08-17</title><id>https://theaggregate.ai/digest/2026-08-17</id><updated>2026-08-17T18:32:32.040913+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LLM2014 Logic 2026-08&lt;/strong&gt; (Median Score): leader GPT-5.5 (xHigh) (73.89), 40 models&lt;br&gt;&lt;span&gt;August 2026 monthly snapshot of the LLM2014 project public leaderboard, scoring models on logic and reasoning problems from its continuously updated test set.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (23)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on OpenAI GPT-5.5 Launch - FrontierMath Tier 1-3: 52.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on OpenAI GPT-5.5 Launch - FrontierMath Tier 4: 39.6 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (3D): 1426.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (Data Viz): 1331.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (Game Dev): 1440.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (UI Components): 1371.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ParseBench: 62.12 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Design Arena (3D): 1372.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Design Arena (UI Components): 1314.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Code Migration: 34.8 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI GPQA: 93.94 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI LegalBench: 87.26 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI LiveCodeBench: 88.65 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI MMLU-Pro: 90.12 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI MMMU: 88.96 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI MedCode: 53.39 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI MedScribe: 83.94 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI MortgageTax: 66.65 (#32)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI ProgramBench: 68.66 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI SAGE: 49.23 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI SWE-bench Verified: 80.8 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI SkillsBench: 65.89 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI TaxEval v2: 74.73 (#29)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Game Dev)&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (1440.0) beat Kimi K3 by 8.0&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-17

=== DAILY ===
NEW BENCHMARKS (1)
  - LLM2014 Logic 2026-08 (Median Score): leader GPT-5.5 (xHigh) (73.89), 40 models
      August 2026 monthly snapshot of the LLM2014 project public leaderboard, scoring models on logic and reasoning problems from its continuously u</summary></entry><entry><title>The Aggregate Digest — 2026-08-16</title><id>https://theaggregate.ai/digest/2026-08-16</id><updated>2026-08-16T05:35:40.031129+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;Top-10 New Scores (17)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Agent Security League - Functional Correctness: 73.7 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on DeepsecBench: 22.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on BabyVision: 88.9 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CADGenBench: 0.5319 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ProphetArena: 0.9506 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Arabic Broad Leaderboard: 9.204 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Chess Puzzles (Epoch AI): 47.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Design Arena (Game Dev): 1310.0 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Design Arena (Website): 1348.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Epoch AI - Mystery Game Puzzles: 37.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on FrontierMath - Tier 4 (v2): 36.59 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on FrontierMath - Tiers 1-3 (v2): 71.58 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Multi-turn Debate (Lechmazur): 1476.3 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OTIS Mock AIME 2024-25: 97.22 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ProgramBench: 0.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ProgramBench Almost: 5.5 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on SimpleQA Verified: 71.2 (#4)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Coarena - Task Completion&lt;/strong&gt;: Qwen 3.8 Max (100.0) beat GPT-5.6 Luna by 15.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BabyVision&lt;/strong&gt;: Qwen3.8-Max (with tools) (91.3) beat GPT-5.5 by 7.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Security League - Security Correctness&lt;/strong&gt;: Claude Opus 5 (32.4) beat Claude Fable 5 by 3.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CADGenBench&lt;/strong&gt;: build123d-mcp-v0381-claude-opus-5-xhigh-full-r6 (0.6391) beat GPT-5.6 Sol (xHigh) by 0.11&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Weekly&lt;/h2&gt;
&lt;h3&gt;New Models (284)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; — ELO 1782, #1&lt;ul&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Terminus-2): 62.0 (#1/22)&lt;/li&gt;&lt;li&gt;ProgramBench: 4.5 (#1/21)&lt;/li&gt;&lt;li&gt;ProgramBench Almost: 37.0 (#1/21)&lt;/li&gt;&lt;li&gt;Android Bench: 91.8 (#1/32)&lt;/li&gt;&lt;li&gt;Design Arena (SVG): 1361.0 (#1/107)&lt;/li&gt;&lt;li&gt;CHI-Bench: 54.7 (#1/26)&lt;/li&gt;&lt;li&gt;NatureBench: 23.33 (#1/13)&lt;/li&gt;&lt;li&gt;Creative Writing (Lechmazur): 4.2 (#1/44)&lt;/li&gt;&lt;li&gt;GameCraft-Bench: 68.44 (#1/14)&lt;/li&gt;&lt;li&gt;Vals AI (Vals Index): 67.21 (#1/46)&lt;/li&gt;&lt;li&gt;...and 25 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; — ELO 1782, #2&lt;ul&gt;&lt;li&gt;AA MMMU-Pro: 85.49 (#1/240)&lt;/li&gt;&lt;li&gt;AutomationBench: 30.4 (#1/10)&lt;/li&gt;&lt;li&gt;LLM Stats (LVBench): 85.4 (#1/25)&lt;/li&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 97.0 (#1/23)&lt;/li&gt;&lt;li&gt;Coarena: 1039.4 (#2/16)&lt;/li&gt;&lt;li&gt;Design Arena (Website): 1348.0 (#2/169)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 94.55 (#2/575)&lt;/li&gt;&lt;li&gt;RuneBench: 10203.0 (#2/46)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1854.0 (#2/313)&lt;/li&gt;&lt;li&gt;LLM Stats (Artificial Analysis): 56.0 (#2/7)&lt;/li&gt;&lt;li&gt;...and 82 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; — ELO 1779, #3&lt;ul&gt;&lt;li&gt;PM-LLM-Benchmark: 37.7 (#9/171)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; — ELO 1777, #4&lt;ul&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Claude Code): 54.0 (#1/4)&lt;/li&gt;&lt;li&gt;FrontierCode: 63.6 (#1/22)&lt;/li&gt;&lt;li&gt;APEX-Agents-AA: 59.2 (#1/28)&lt;/li&gt;&lt;li&gt;Vals Index: 75.14 (#1/40)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 74.15 (#1/29)&lt;/li&gt;&lt;li&gt;ArxivMath: 87.5 (#2/17)&lt;/li&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Terminus-2): 50.8 (#3/22)&lt;/li&gt;&lt;li&gt;MedCode: 56.07 (#3/75)&lt;/li&gt;&lt;li&gt;MedScribe: 88.52 (#3/74)&lt;/li&gt;&lt;li&gt;ProofBench: 77.0 (#3/54)&lt;/li&gt;&lt;li&gt;...and 4 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; — ELO 1772, #5&lt;ul&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Codex CLI): 58.0 (#1/4)&lt;/li&gt;&lt;li&gt;LLM Chess (Saplin): 1549.7 (#1/158)&lt;/li&gt;&lt;li&gt;GDP.pdf: 30.7 (#1/24)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 136.0 (#1/115)&lt;/li&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Terminus-2): 51.6 (#2/22)&lt;/li&gt;&lt;li&gt;CADGenBench: 0.5319 (#2/23)&lt;/li&gt;&lt;li&gt;ProgramBench: 1.0 (#2/21)&lt;/li&gt;&lt;li&gt;OpenRouter HLE (Search): 71.1 (#2/2)&lt;/li&gt;&lt;li&gt;OpenRouter BrowseComp (Search): 82.4 (#2/5)&lt;/li&gt;&lt;li&gt;OpenRouter DeepSearchQA (Search): 75.0 (#2/4)&lt;/li&gt;&lt;li&gt;...and 24 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; — ELO 1756, #7&lt;ul&gt;&lt;li&gt;Design Arena (Game Dev): 1432.0 (#1/155)&lt;/li&gt;&lt;li&gt;DeepSearchQA: 95.0 (#1/15)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1674.0 (#2/48)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1674.48 (#2/25)&lt;/li&gt;&lt;li&gt;Vals Index: 74.7 (#3/40)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 73.42 (#3/29)&lt;/li&gt;&lt;li&gt;Android Bench: 90.2 (#4/32)&lt;/li&gt;&lt;li&gt;Design Arena (SVG): 1339.0 (#4/107)&lt;/li&gt;&lt;li&gt;BabyVision: 85.7 (#4/29)&lt;/li&gt;&lt;li&gt;MCP Atlas: 84.2 (#4/39)&lt;/li&gt;&lt;li&gt;...and 22 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; — ELO 1751, #8&lt;ul&gt;&lt;li&gt;Coarena - Task Completion: 100.0 (#1/16)&lt;/li&gt;&lt;li&gt;SpatialGen-Bench (Text Answering): 81.74 (#1/27)&lt;/li&gt;&lt;li&gt;LLM Stats (WideSearch): 81.9 (#1/10)&lt;/li&gt;&lt;li&gt;LLM Stats (Agents' Last Exam): 52.4 (#2/10)&lt;/li&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 92.9 (#2/23)&lt;/li&gt;&lt;li&gt;Vals AI IOI: 73.0 (#3/62)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1671.0 (#3/48)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1671.13 (#3/25)&lt;/li&gt;&lt;li&gt;Vals AI GPQA: 93.69 (#4/132)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 88.07 (#4/225)&lt;/li&gt;&lt;li&gt;...and 43 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.2&lt;/strong&gt; — ELO 1751, #9&lt;ul&gt;&lt;li&gt;LMArena Text Arena: 1498.64 (#4/24)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Maths: 94.44 (#5/233)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 88.07 (#5/225)&lt;/li&gt;&lt;li&gt;FoodTruckBench: 41904.0 (#7/10)&lt;/li&gt;&lt;li&gt;SimpleBench: 74.5 (#8/93)&lt;/li&gt;&lt;li&gt;Vals AI IOI: 49.5 (#9/62)&lt;/li&gt;&lt;li&gt;Coarena: 1001.7 (#10/16)&lt;/li&gt;&lt;li&gt;RuneBench: 5677.0 (#10/46)&lt;/li&gt;&lt;li&gt;Vals AI (Vals Index): 57.05 (#11/46)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSWE 1.1): 59.3 (#11/25)&lt;/li&gt;&lt;li&gt;...and 22 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.6 Flash&lt;/strong&gt; — ELO 1748, #10&lt;ul&gt;&lt;li&gt;ProgramBench: 0.5 (#5/21)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 56.3 (#5/40)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Vision): 1295.0 (#7/145)&lt;/li&gt;&lt;li&gt;MedCode: 53.15 (#8/75)&lt;/li&gt;&lt;li&gt;ProgramBench Almost: 4.0 (#9/21)&lt;/li&gt;&lt;li&gt;Android Bench: 75.6 (#10/32)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 62.8 (#14/29)&lt;/li&gt;&lt;li&gt;LMArena Text Arena: 1483.64 (#15/24)&lt;/li&gt;&lt;li&gt;Vals Index: 62.43 (#15/40)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Text): 1484.0 (#16/391)&lt;/li&gt;&lt;li&gt;...and 11 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5&lt;/strong&gt; — ELO 1747, #11&lt;ul&gt;&lt;li&gt;HardMTBench: 91.4 (#1/22)&lt;/li&gt;&lt;li&gt;PhysicianBench: 46.3 (#1/12)&lt;/li&gt;&lt;li&gt;SWE Atlas: 45.4 (#1/15)&lt;/li&gt;&lt;li&gt;ALE-Bench: 1942.97 (#1/89)&lt;/li&gt;&lt;li&gt;LiveBench: 81.28 (#1/48)&lt;/li&gt;&lt;li&gt;ClawProBench: 67.9 (#1/57)&lt;/li&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Codex CLI): 51.6 (#2/4)&lt;/li&gt;&lt;li&gt;MathArena Apex: 80.21 (#2/50)&lt;/li&gt;&lt;li&gt;ATLAS: 67.77 (#3/23)&lt;/li&gt;&lt;li&gt;GeneBench: 25.0 (#3/16)&lt;/li&gt;&lt;li&gt;...and 22 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; — ELO 1746, #12&lt;ul&gt;&lt;li&gt;MCP Atlas: 88.1 (#1/39)&lt;/li&gt;&lt;li&gt;MedScribe: 88.89 (#2/74)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 57.21 (#3/40)&lt;/li&gt;&lt;li&gt;CharXiv-R: 88.4 (#5/58)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 80.8 (#6/27)&lt;/li&gt;&lt;li&gt;Vals Index: 68.41 (#8/40)&lt;/li&gt;&lt;li&gt;DeepSearchQA: 84.9 (#10/15)&lt;/li&gt;&lt;li&gt;LMArena Text Arena: 1488.67 (#10/24)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 66.74 (#10/29)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1472.0 (#12/38)&lt;/li&gt;&lt;li&gt;...and 3 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.6&lt;/strong&gt; — ELO 1746, #13&lt;ul&gt;&lt;li&gt;CursorBench 3.1: 70.8 (#1/45)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 94.95 (#1/575)&lt;/li&gt;&lt;li&gt;RuneBench: 12757.0 (#1/46)&lt;/li&gt;&lt;li&gt;LLM Stats (APEX-Agents): 57.5 (#1/8)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - BioSecBench-Surveillance: 56.3 (#2/17)&lt;/li&gt;&lt;li&gt;Benchmarks.bio - VariantBench: 44.63 (#2/14)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 50.72 (#2/166)&lt;/li&gt;&lt;li&gt;SealedBench: 70.0 (#2/30)&lt;/li&gt;&lt;li&gt;FrontierCode: 61.3 (#2/22)&lt;/li&gt;&lt;li&gt;APEX-Agents-AA: 57.5 (#2/28)&lt;/li&gt;&lt;li&gt;...and 92 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Pro (Preview)&lt;/strong&gt; — ELO 1738, #14&lt;ul&gt;&lt;li&gt;AudioMC: 66.8 (#1/33)&lt;/li&gt;&lt;li&gt;MMAU: 82.5 (#1/31)&lt;/li&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Gemini CLI): 19.6 (#2/2)&lt;/li&gt;&lt;li&gt;MedCode: 59.06 (#2/75)&lt;/li&gt;&lt;li&gt;MathArena Apex: 60.94 (#4/50)&lt;/li&gt;&lt;li&gt;MirrorCode: 8.9 (#6/6)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 59.72 (#9/53)&lt;/li&gt;&lt;li&gt;PhysicianBench: 6.0 (#11/12)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 76.2 (#12/27)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 64.84 (#12/54)&lt;/li&gt;&lt;li&gt;...and 15 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; — ELO 1735, #15&lt;ul&gt;&lt;li&gt;IOI: 46.75 (#13/64)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 47.78 (#18/40)&lt;/li&gt;&lt;li&gt;Vals Index: 57.49 (#18/40)&lt;/li&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Terminus-2): 9.8 (#19/22)&lt;/li&gt;&lt;li&gt;ProofBench: 26.0 (#22/54)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 118.0 (#26/115)&lt;/li&gt;&lt;li&gt;Android Bench: 54.2 (#27/32)&lt;/li&gt;&lt;li&gt;Vals AI Code Migration: 13.07 (#33/48)&lt;/li&gt;&lt;li&gt;MedScribe: 79.4 (#35/74)&lt;/li&gt;&lt;li&gt;MedCode: 38.75 (#44/75)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash&lt;/strong&gt; — ELO 1734, #16&lt;ul&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Gemini CLI): 24.4 (#1/2)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 57.86 (#2/40)&lt;/li&gt;&lt;li&gt;MedCode: 55.83 (#5/75)&lt;/li&gt;&lt;li&gt;ProgramBench Almost: 3.0 (#10/21)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 78.4 (#10/27)&lt;/li&gt;&lt;li&gt;ProgramBench: 0.0 (#11/21)&lt;/li&gt;&lt;li&gt;Harvey Legal Agent Benchmark: 0.8 (#11/12)&lt;/li&gt;&lt;li&gt;MathArena Apex: 32.29 (#11/50)&lt;/li&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Terminus-2): 22.8 (#12/22)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 62.93 (#13/29)&lt;/li&gt;&lt;li&gt;...and 8 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.5&lt;/strong&gt; — ELO 1733, #17&lt;ul&gt;&lt;li&gt;FrontierCode: 56.6 (#4/22)&lt;/li&gt;&lt;li&gt;APEX-Agents-AA: 47.1 (#4/28)&lt;/li&gt;&lt;li&gt;MedScribe: 86.88 (#7/74)&lt;/li&gt;&lt;li&gt;Vals Index: 65.3 (#11/40)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 63.42 (#12/29)&lt;/li&gt;&lt;li&gt;Vals AI ProofBench: 31.0 (#16/24)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 124.0 (#16/115)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 48.35 (#16/40)&lt;/li&gt;&lt;li&gt;DeepsecBench: 15.58 (#17/35)&lt;/li&gt;&lt;li&gt;ProofBench: 30.0 (#19/54)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; — ELO 1731, #18&lt;ul&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Claude Code): 38.0 (#3/4)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 22.52 (#3/48)&lt;/li&gt;&lt;li&gt;DeepSearchQA: 93.1 (#5/15)&lt;/li&gt;&lt;li&gt;LiveBench: 77.55 (#5/48)&lt;/li&gt;&lt;li&gt;Vals Index: 70.36 (#5/40)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 70.89 (#5/29)&lt;/li&gt;&lt;li&gt;MCP Atlas: 83.6 (#7/39)&lt;/li&gt;&lt;li&gt;ArxivMath: 65.0 (#7/17)&lt;/li&gt;&lt;li&gt;MedCode: 53.22 (#7/75)&lt;/li&gt;&lt;li&gt;ProofBench: 69.0 (#7/54)&lt;/li&gt;&lt;li&gt;...and 16 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Terra&lt;/strong&gt; — ELO 1728, #20&lt;ul&gt;&lt;li&gt;ProofBench: 71.0 (#4/54)&lt;/li&gt;&lt;li&gt;AutomationBench: 21.0 (#6/10)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 132.0 (#6/115)&lt;/li&gt;&lt;li&gt;Android Bench: 86.8 (#7/32)&lt;/li&gt;&lt;li&gt;LLM Chess (Saplin): 1293.0 (#7/158)&lt;/li&gt;&lt;li&gt;VoxelBench: 1936.0 (#8/44)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1479.0 (#10/38)&lt;/li&gt;&lt;li&gt;IOI: 65.25 (#10/64)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 52.42 (#11/40)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 65.07 (#11/29)&lt;/li&gt;&lt;li&gt;...and 5 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro (0813)&lt;/strong&gt; — ELO 1724, #21&lt;ul&gt;&lt;li&gt;LLM Stats (NL2Repo): 61.5 (#1/17)&lt;/li&gt;&lt;li&gt;LLM Stats (AutomationBench): 31.8 (#2/12)&lt;/li&gt;&lt;li&gt;LLM Stats (CyberGym): 83.3 (#2/13)&lt;/li&gt;&lt;li&gt;LLM Stats (Toolathlon): 74.1 (#2/37)&lt;/li&gt;&lt;li&gt;Vals AI SWE-bench Verified: 96.4 (#2/82)&lt;/li&gt;&lt;li&gt;NL2Repo: 61.5 (#2/21)&lt;/li&gt;&lt;li&gt;CyberGym: 83.3 (#2/16)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 87.9 (#4/28)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSWE): 62.7 (#5/11)&lt;/li&gt;&lt;li&gt;Vals AI Vibe Code Bench: 82.3 (#5/84)&lt;/li&gt;&lt;li&gt;...and 63 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Pro (Preview)&lt;/strong&gt; — ELO 1718, #23&lt;ul&gt;&lt;li&gt;OpenEval - GPQA CoT: 80.27 (#1/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 90.3 (#1/77)&lt;/li&gt;&lt;li&gt;MATH 500: 96.4 (#1/60)&lt;/li&gt;&lt;li&gt;Vals AI MMLU-Pro: 90.1 (#4/132)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 55.55 (#5/74)&lt;/li&gt;&lt;li&gt;HMMT 2025: 97.5 (#5/82)&lt;/li&gt;&lt;li&gt;MGSM: 93.93 (#7/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 87.65 (#8/77)&lt;/li&gt;&lt;li&gt;MedCode: 52.2 (#10/75)&lt;/li&gt;&lt;li&gt;MathArena Apex: 23.44 (#15/50)&lt;/li&gt;&lt;li&gt;...and 10 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Pro&lt;/strong&gt; — ELO 1718, #24&lt;ul&gt;&lt;li&gt;FINAL Bench Metacognitive: 77.08 (#2/9)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1722.0 (#3/34)&lt;/li&gt;&lt;li&gt;MolViBench: 36.0 (#4/15)&lt;/li&gt;&lt;li&gt;IDE-Bench: 55.0 (#8/15)&lt;/li&gt;&lt;li&gt;LMArena Text Arena: 1485.45 (#14/24)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4&lt;/strong&gt; — ELO 1714, #25&lt;ul&gt;&lt;li&gt;Sandboxed Coding Agents are Competitive Omni-m: 75.0 (#1/16)&lt;/li&gt;&lt;li&gt;PlanningBench: 63.17 (#1/18)&lt;/li&gt;&lt;li&gt;Vision2Code: 4.12 (#1/13)&lt;/li&gt;&lt;li&gt;APEX-Agents: 52.7 (#2/45)&lt;/li&gt;&lt;li&gt;LiveBench: 80.91 (#2/48)&lt;/li&gt;&lt;li&gt;LLM Arena RU: 1187.0 (#3/104)&lt;/li&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Codex CLI): 38.0 (#3/4)&lt;/li&gt;&lt;li&gt;FAM-Bench: 82.4 (#4/25)&lt;/li&gt;&lt;li&gt;ATLAS: 63.23 (#4/23)&lt;/li&gt;&lt;li&gt;PrivacySIM: 38.77 (#4/7)&lt;/li&gt;&lt;li&gt;...and 25 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.7&lt;/strong&gt; — ELO 1714, #26&lt;ul&gt;&lt;li&gt;Finance Agent v1.1: 64.37 (#1/53)&lt;/li&gt;&lt;li&gt;MirrorCode: 31.1 (#2/6)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Vision): 1301.0 (#3/145)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Text): 1502.0 (#3/391)&lt;/li&gt;&lt;li&gt;KnotBench: 51.65 (#3/4)&lt;/li&gt;&lt;li&gt;PhysicianBench: 29.3 (#3/12)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 68.38 (#5/54)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Document): 1497.0 (#6/39)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1497.0 (#6/38)&lt;/li&gt;&lt;li&gt;LiveBench: 77.1 (#6/48)&lt;/li&gt;&lt;li&gt;...and 22 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.2&lt;/strong&gt; — ELO 1709, #27&lt;ul&gt;&lt;li&gt;Arena AI Code: 1588.0 (#7/48)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1588.2 (#7/25)&lt;/li&gt;&lt;li&gt;GameCraft-Bench: 39.12 (#9/14)&lt;/li&gt;&lt;li&gt;MCP Atlas: 82.6 (#9/39)&lt;/li&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Terminus-2): 31.4 (#10/22)&lt;/li&gt;&lt;li&gt;ProphetArena: 0.9418 (#10/17)&lt;/li&gt;&lt;li&gt;ArxivMath: 56.67 (#10/17)&lt;/li&gt;&lt;li&gt;Vals Index: 65.02 (#13/40)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 61.53 (#15/46)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 49.7 (#15/40)&lt;/li&gt;&lt;li&gt;...and 6 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 5&lt;/strong&gt; — ELO 1709, #28&lt;ul&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Claude Code): 25.6 (#4/4)&lt;/li&gt;&lt;li&gt;Vals Index: 68.61 (#7/40)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 68.83 (#7/29)&lt;/li&gt;&lt;li&gt;ProofBench: 66.0 (#8/54)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 53.91 (#9/40)&lt;/li&gt;&lt;li&gt;Blueprint-Bench 2: 0.249 (#13/23)&lt;/li&gt;&lt;li&gt;Vals AI MedCode: 47.54 (#22/84)&lt;/li&gt;&lt;li&gt;LLM Chess (Saplin): 897.0 (#23/158)&lt;/li&gt;&lt;li&gt;MedScribe: 76.05 (#49/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Luna&lt;/strong&gt; — ELO 1707, #29&lt;ul&gt;&lt;li&gt;OpenRouter DeepSearchQA (Search): 73.0 (#3/4)&lt;/li&gt;&lt;li&gt;OpenRouter BrowseComp (Search): 74.0 (#4/5)&lt;/li&gt;&lt;li&gt;Android Bench: 87.6 (#5/32)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 55.04 (#6/40)&lt;/li&gt;&lt;li&gt;Vals Index: 69.88 (#6/40)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 69.06 (#6/29)&lt;/li&gt;&lt;li&gt;IOI: 72.92 (#7/64)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 129.0 (#9/115)&lt;/li&gt;&lt;li&gt;VoxelBench: 1871.0 (#10/44)&lt;/li&gt;&lt;li&gt;FoodTruckBench: 32932.0 (#10/10)&lt;/li&gt;&lt;li&gt;...and 8 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.1 Turbo&lt;/strong&gt; — ELO 1707, #30&lt;ul&gt;&lt;li&gt;SvelteBench: 88.9 (#70/169)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 40.0 (#241/419)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.6&lt;/strong&gt; — ELO 1706, #31&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 50.3 (#1/21)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1747.0 (#1/34)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Text): 1505.0 (#2/391)&lt;/li&gt;&lt;li&gt;PhysicianBench: 31.7 (#2/12)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Document): 1506.0 (#3/39)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1506.0 (#3/38)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 75.6 (#4/47)&lt;/li&gt;&lt;li&gt;Chatbot Arena (Vision): 1300.0 (#4/145)&lt;/li&gt;&lt;li&gt;LMArena Text Arena: 1497.59 (#5/24)&lt;/li&gt;&lt;li&gt;FINAL Bench Metacognitive: 76.17 (#5/9)&lt;/li&gt;&lt;li&gt;...and 16 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 Max Preview&lt;/strong&gt; — ELO 1705, #32&lt;ul&gt;&lt;li&gt;Finance Agent v1.1: 52.78 (#24/53)&lt;/li&gt;&lt;li&gt;ClawProBench: 57.4 (#26/57)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 47.91 (#51/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2 Codex&lt;/strong&gt; — ELO 1705, #33&lt;ul&gt;&lt;li&gt;APEX v1 Consulting: 66.9 (#1/18)&lt;/li&gt;&lt;li&gt;APEX v1: 65.3 (#4/5)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 61.8 (#5/18)&lt;/li&gt;&lt;li&gt;Vals AI LiveCodeBench: 87.99 (#6/137)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 72.8 (#7/47)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 73.0 (#8/18)&lt;/li&gt;&lt;li&gt;ALE-Bench: 1299.9 (#8/89)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 59.7 (#9/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Flash (Preview)&lt;/strong&gt; — ELO 1704, #34&lt;ul&gt;&lt;li&gt;MedCode: 55.92 (#4/75)&lt;/li&gt;&lt;li&gt;MGSM: 93.31 (#10/74)&lt;/li&gt;&lt;li&gt;IOI: 39.08 (#15/64)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 52.19 (#22/29)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 42.55 (#26/40)&lt;/li&gt;&lt;li&gt;Vals Index: 49.55 (#28/40)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 18.27 (#30/49)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 15.0 (#32/52)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 55.84 (#33/54)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 47.6 (#33/53)&lt;/li&gt;&lt;li&gt;...and 5 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.3 Codex&lt;/strong&gt; — ELO 1703, #35&lt;ul&gt;&lt;li&gt;APEX v1 Investment Banking: 65.0 (#1/18)&lt;/li&gt;&lt;li&gt;SmellBench: 44.4 (#2/10)&lt;/li&gt;&lt;li&gt;ALE-Bench: 1655.22 (#2/89)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 65.5 (#4/18)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1717.0 (#4/34)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 69.8 (#12/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 58.1 (#14/18)&lt;/li&gt;&lt;li&gt;IOI: 43.83 (#14/64)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 119.0 (#23/115)&lt;/li&gt;&lt;li&gt;LiveBench: 71.97 (#31/48)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.7 Code&lt;/strong&gt; — ELO 1702, #37&lt;ul&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Terminus-2): 15.4 (#15/22)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Flash&lt;/strong&gt; — ELO 1701, #38&lt;ul&gt;&lt;li&gt;SWE-bench Verified: 75.8 (#2/47)&lt;/li&gt;&lt;li&gt;OCR-Robust: 79.05 (#3/18)&lt;/li&gt;&lt;li&gt;HMMT 2025: 97.5 (#7/82)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1622.0 (#11/34)&lt;/li&gt;&lt;li&gt;MathArena Apex: 15.62 (#18/50)&lt;/li&gt;&lt;li&gt;InfoOps Bench: 20.1 (#33/37)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 116.0 (#33/115)&lt;/li&gt;&lt;li&gt;OmniDocBench 1.5: 0.12 (#65/65)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Plus&lt;/strong&gt; — ELO 1698, #40&lt;ul&gt;&lt;li&gt;Vals Multimodal Index: 53.89 (#20/29)&lt;/li&gt;&lt;li&gt;Vals Index: 52.33 (#24/40)&lt;/li&gt;&lt;li&gt;Android Bench: 57.7 (#25/32)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 116.0 (#29/115)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 38.22 (#29/40)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 16.35 (#31/49)&lt;/li&gt;&lt;li&gt;Vals AI Code Migration: 12.86 (#35/48)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash (0731)&lt;/strong&gt; — ELO 1694, #41&lt;ul&gt;&lt;li&gt;OpenRouter BrowseComp (Search): 77.0 (#3/5)&lt;/li&gt;&lt;li&gt;OpenRouter DeepSearchQA (Search): 72.0 (#4/4)&lt;/li&gt;&lt;li&gt;GameCraft-Bench: 40.61 (#7/14)&lt;/li&gt;&lt;li&gt;Vals AI ProofBench: 56.0 (#11/24)&lt;/li&gt;&lt;li&gt;Vals AI Code Migration: 38.63 (#12/48)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 34.0 (#14/53)&lt;/li&gt;&lt;li&gt;RuneBench: 2816.0 (#20/46)&lt;/li&gt;&lt;li&gt;SvelteBench: 95.1 (#33/169)&lt;/li&gt;&lt;li&gt;EQ-Bench Longform Writing: 61.2 (#51/126)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5&lt;/strong&gt; — ELO 1691, #42&lt;ul&gt;&lt;li&gt;APEX v1 Big Law: 76.6 (#1/18)&lt;/li&gt;&lt;li&gt;LingOly-TOO: 46.7 (#1/16)&lt;/li&gt;&lt;li&gt;MCP-Universe: 43.72 (#2/28)&lt;/li&gt;&lt;li&gt;KnotBench: 43.0 (#4/4)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 62.4 (#5/18)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 44.1 (#6/21)&lt;/li&gt;&lt;li&gt;VTB: 16.96 (#6/20)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 60.0 (#8/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 59.1 (#9/18)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1536.0 (#29/34)&lt;/li&gt;&lt;li&gt;...and 3 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.5&lt;/strong&gt; — ELO 1691, #43&lt;ul&gt;&lt;li&gt;SWE-bench Verified: 76.8 (#1/47)&lt;/li&gt;&lt;li&gt;IDE-Bench: 83.75 (#3/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nex N2 Pro&lt;/strong&gt; — ELO 1691, #44&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 109.0 (#46/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2&lt;/strong&gt; — ELO 1690, #46&lt;ul&gt;&lt;li&gt;MolDeTox: 15.59 (#1/18)&lt;/li&gt;&lt;li&gt;IDE-Bench: 85.0 (#2/15)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1737.0 (#2/34)&lt;/li&gt;&lt;li&gt;FINAL Bench Metacognitive: 76.5 (#3/9)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 62.3 (#4/18)&lt;/li&gt;&lt;li&gt;APEX-Agents: 48.4 (#4/45)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 73.4 (#6/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 61.4 (#6/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 61.9 (#6/18)&lt;/li&gt;&lt;li&gt;MGSM: 94.0 (#6/74)&lt;/li&gt;&lt;li&gt;...and 16 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.6&lt;/strong&gt; — ELO 1690, #47&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 48.1 (#2/21)&lt;/li&gt;&lt;li&gt;PhysicianBench: 17.0 (#7/12)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 57.06 (#14/53)&lt;/li&gt;&lt;li&gt;ClawProBench: 59.31 (#17/57)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 56.43 (#17/29)&lt;/li&gt;&lt;li&gt;Vals Index: 55.17 (#20/40)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 61.2 (#22/54)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 44.9 (#22/40)&lt;/li&gt;&lt;li&gt;Inverse Turing Bench: 57.45 (#26/40)&lt;/li&gt;&lt;li&gt;Mercor APEX: 18.9 (#29/53)&lt;/li&gt;&lt;li&gt;...and 3 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hy3&lt;/strong&gt; — ELO 1689, #48&lt;ul&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Terminus-2): 18.0 (#13/22)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 103.0 (#65/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.5 (20251101)&lt;/strong&gt; — ELO 1688, #49&lt;ul&gt;&lt;li&gt;MGSM: 95.2 (#1/74)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 74.4 (#5/47)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 36.0 (#15/52)&lt;/li&gt;&lt;li&gt;MultiNRC: 41.23 (#17/43)&lt;/li&gt;&lt;li&gt;TutorBench: 49.82 (#18/27)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 62.59 (#18/54)&lt;/li&gt;&lt;li&gt;IOI: 23.58 (#21/64)&lt;/li&gt;&lt;li&gt;EnigmaEval: 4.65 (#22/43)&lt;/li&gt;&lt;li&gt;MedCode: 45.17 (#24/75)&lt;/li&gt;&lt;li&gt;MedScribe: 83.25 (#24/74)&lt;/li&gt;&lt;li&gt;...and 3 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.1&lt;/strong&gt; — ELO 1686, #50&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 45.0 (#5/21)&lt;/li&gt;&lt;li&gt;ArxivMath: 52.5 (#12/17)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 57.66 (#12/53)&lt;/li&gt;&lt;li&gt;MathArena Apex: 11.5 (#21/50)&lt;/li&gt;&lt;li&gt;Vals Index: 52.45 (#22/40)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 44.79 (#23/40)&lt;/li&gt;&lt;li&gt;ProofBench: 22.22 (#24/54)&lt;/li&gt;&lt;li&gt;MedCode: 41.6 (#32/75)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 51.55 (#48/54)&lt;/li&gt;&lt;li&gt;MedScribe: 72.27 (#59/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; — ELO 1686, #51&lt;ul&gt;&lt;li&gt;AudioMC: 56.6 (#2/33)&lt;/li&gt;&lt;li&gt;MMAU: 77.2 (#2/31)&lt;/li&gt;&lt;li&gt;MedScribe: 85.41 (#13/74)&lt;/li&gt;&lt;li&gt;Coarena: 998.6 (#14/16)&lt;/li&gt;&lt;li&gt;Coarena - Task Completion: 40.0 (#14/16)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 46.6 (#20/40)&lt;/li&gt;&lt;li&gt;MCP Atlas: 74.1 (#21/39)&lt;/li&gt;&lt;li&gt;Vals Index: 49.28 (#29/40)&lt;/li&gt;&lt;li&gt;DeepsecBench: 6.32 (#30/35)&lt;/li&gt;&lt;li&gt;CharXiv-R: 78.1 (#33/58)&lt;/li&gt;&lt;li&gt;...and 8 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro&lt;/strong&gt; — ELO 1684, #52&lt;ul&gt;&lt;li&gt;MathArena Apex: 90.2 (#1/50)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 47.2 (#4/21)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 60.39 (#5/53)&lt;/li&gt;&lt;li&gt;DeepSWE: 62.8 (#12/27)&lt;/li&gt;&lt;li&gt;NYT Connections Extended: 88.4 (#17/104)&lt;/li&gt;&lt;li&gt;Creative Writing (Lechmazur): 0.8 (#17/44)&lt;/li&gt;&lt;li&gt;IOI: 35.83 (#17/64)&lt;/li&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Terminus-2): 10.4 (#18/22)&lt;/li&gt;&lt;li&gt;Vals Index: 55.62 (#19/40)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 44.08 (#24/40)&lt;/li&gt;&lt;li&gt;...and 6 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.0 Pro&lt;/strong&gt; — ELO 1684, #53&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 47.4 (#3/21)&lt;/li&gt;&lt;li&gt;Creative Writing (Lechmazur): -1.5 (#33/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 Plus&lt;/strong&gt; — ELO 1683, #54&lt;ul&gt;&lt;li&gt;ClawProBench: 64.19 (#3/57)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 54.48 (#19/53)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 59.7 (#26/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Codex&lt;/strong&gt; — ELO 1682, #55&lt;ul&gt;&lt;li&gt;APEX v1 Big Law: 73.5 (#5/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 60.3 (#7/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 59.8 (#7/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 57.6 (#16/18)&lt;/li&gt;&lt;li&gt;Lean AI Formalization Leaderboard: 1.0 (#30/56)&lt;/li&gt;&lt;li&gt;IOI: 9.75 (#38/64)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 (2025-08-07)&lt;/strong&gt; — ELO 1681, #56&lt;ul&gt;&lt;li&gt;MATH 500: 96.0 (#3/60)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 66.45 (#6/54)&lt;/li&gt;&lt;li&gt;MedCode: 49.63 (#14/75)&lt;/li&gt;&lt;li&gt;MGSM: 92.84 (#14/74)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 65.0 (#21/47)&lt;/li&gt;&lt;li&gt;MedScribe: 83.65 (#22/74)&lt;/li&gt;&lt;li&gt;IOI: 20.0 (#26/64)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 52.15 (#27/53)&lt;/li&gt;&lt;li&gt;ProofBench: 18.0 (#29/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 397B A17B&lt;/strong&gt; — ELO 1680, #57&lt;ul&gt;&lt;li&gt;HarmActionsEval: 23.4 (#1/10)&lt;/li&gt;&lt;li&gt;ClawProBench: 64.18 (#4/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 Plus&lt;/strong&gt; — ELO 1679, #58&lt;ul&gt;&lt;li&gt;PhysicianBench: 13.7 (#9/12)&lt;/li&gt;&lt;li&gt;ClawProBench: 60.2 (#14/57)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 54.63 (#17/53)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 51.52 (#23/29)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 40.85 (#28/40)&lt;/li&gt;&lt;li&gt;Vals Index: 48.89 (#30/40)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 1.25 (#31/50)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 32.87 (#35/46)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 14.9 (#37/49)&lt;/li&gt;&lt;li&gt;MedScribe: 76.96 (#44/74)&lt;/li&gt;&lt;li&gt;...and 3 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5-Pro&lt;/strong&gt; — ELO 1679, #59&lt;ul&gt;&lt;li&gt;ClawProBench: 63.3 (#5/57)&lt;/li&gt;&lt;li&gt;PhysicianBench: 16.7 (#8/12)&lt;/li&gt;&lt;li&gt;MedScribe: 83.73 (#21/74)&lt;/li&gt;&lt;li&gt;Android Bench: 60.8 (#23/32)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 2.08 (#23/50)&lt;/li&gt;&lt;li&gt;ProofBench: 24.0 (#23/54)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 41.5 (#27/40)&lt;/li&gt;&lt;li&gt;Vals Index: 50.74 (#27/40)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 15.87 (#32/49)&lt;/li&gt;&lt;li&gt;MedCode: 32.48 (#62/75)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M3&lt;/strong&gt; — ELO 1678, #60&lt;ul&gt;&lt;li&gt;Android Bench: 63.6 (#20/32)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 14.0 (#102/161)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 71.11 (#116/238)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.6&lt;/strong&gt; — ELO 1677, #61&lt;ul&gt;&lt;li&gt;Finance Agent v1.1: 63.33 (#2/53)&lt;/li&gt;&lt;li&gt;HarmActionsEval: 2.84 (#4/10)&lt;/li&gt;&lt;li&gt;PhysicianBench: 23.0 (#5/12)&lt;/li&gt;&lt;li&gt;ProphetArena: 0.9437 (#8/17)&lt;/li&gt;&lt;li&gt;GDP.pdf: 18.0 (#10/24)&lt;/li&gt;&lt;li&gt;ClawProBench: 60.5 (#11/57)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 63.99 (#14/54)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 51.03 (#14/40)&lt;/li&gt;&lt;li&gt;ProofBench: 45.0 (#14/54)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 60.57 (#15/29)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3&lt;/strong&gt; — ELO 1675, #63&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 40.3 (#8/21)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1609.0 (#13/34)&lt;/li&gt;&lt;li&gt;HMMT 2025: 77.5 (#45/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Codex&lt;/strong&gt; — ELO 1675, #64&lt;ul&gt;&lt;li&gt;APEX v1 Big Law: 73.2 (#7/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 58.7 (#10/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 57.6 (#11/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 58.1 (#13/18)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 66.0 (#19/47)&lt;/li&gt;&lt;li&gt;Vals AI LiveCodeBench: 85.55 (#28/137)&lt;/li&gt;&lt;li&gt;Design Arena (UI Components): 1265.0 (#38/148)&lt;/li&gt;&lt;li&gt;IOI: 3.67 (#54/64)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.3&lt;/strong&gt; — ELO 1673, #65&lt;ul&gt;&lt;li&gt;HarmActionsEval: 12.77 (#2/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling Small&lt;/strong&gt; — ELO 1673, #66&lt;ul&gt;&lt;li&gt;LLM Stats (AIME 2026): 95.5 (#4/21)&lt;/li&gt;&lt;li&gt;LLM Stats (Artificial Analysis): 40.0 (#7/7)&lt;/li&gt;&lt;li&gt;LLM Stats (MCP Atlas): 79.6 (#7/33)&lt;/li&gt;&lt;li&gt;LLM Stats (Toolathlon): 54.4 (#12/37)&lt;/li&gt;&lt;li&gt;OpenRouter GPQA Diamond: 87.2 (#21/114)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 64.7 (#22/28)&lt;/li&gt;&lt;li&gt;LLM Stats (BrowseComp): 77.4 (#23/62)&lt;/li&gt;&lt;li&gt;ZeroEval GPQA Diamond: 89.5 (#26/239)&lt;/li&gt;&lt;li&gt;LLM Stats (CharXiv-R): 77.4 (#30/51)&lt;/li&gt;&lt;li&gt;FrontierMath - Tier 4 (v2): 17.07 (#32/50)&lt;/li&gt;&lt;li&gt;...and 17 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.5&lt;/strong&gt; — ELO 1670, #67&lt;ul&gt;&lt;li&gt;IDE-Bench: 87.5 (#1/15)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 86.9 (#3/77)&lt;/li&gt;&lt;li&gt;MGSM: 94.33 (#4/74)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 68.61 (#6/74)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 55.3 (#6/74)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 41.7 (#7/21)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 71.4 (#11/47)&lt;/li&gt;&lt;li&gt;OR-Space: 53.0 (#11/19)&lt;/li&gt;&lt;li&gt;VTB: 5.6 (#11/20)&lt;/li&gt;&lt;li&gt;DentalGPT Dental Eval Suite: 51.7 (#12/17)&lt;/li&gt;&lt;li&gt;...and 18 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.3&lt;/strong&gt; — ELO 1670, #68&lt;ul&gt;&lt;li&gt;CaseLaw v2: 79.31 (#1/54)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 53.81 (#20/53)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 43.29 (#25/29)&lt;/li&gt;&lt;li&gt;Chess Bench LLM: 956.0 (#29/110)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 37.73 (#31/40)&lt;/li&gt;&lt;li&gt;IOI: 15.33 (#31/64)&lt;/li&gt;&lt;li&gt;Vals Index: 46.48 (#32/40)&lt;/li&gt;&lt;li&gt;Vals AI LiveCodeBench: 84.49 (#36/137)&lt;/li&gt;&lt;li&gt;ProofBench: 11.0 (#38/54)&lt;/li&gt;&lt;li&gt;Vals AI MMLU-Pro: 85.84 (#48/132)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash Lite&lt;/strong&gt; — ELO 1669, #69&lt;ul&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.28 (#3/48)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 12.73 (#5/48)&lt;/li&gt;&lt;li&gt;Agent Arena - Steerability: 10.28 (#7/48)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 15.08 (#7/48)&lt;/li&gt;&lt;li&gt;Agent Arena: 10.38 (#10/48)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 13.51 (#15/48)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 47.44 (#19/40)&lt;/li&gt;&lt;li&gt;IOI: 26.17 (#20/64)&lt;/li&gt;&lt;li&gt;Vals Index: 51.0 (#26/40)&lt;/li&gt;&lt;li&gt;MedCode: 43.49 (#27/75)&lt;/li&gt;&lt;li&gt;...and 8 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro&lt;/strong&gt; — ELO 1668, #70&lt;ul&gt;&lt;li&gt;LingOly-TOO: 42.3539 (#4/16)&lt;/li&gt;&lt;li&gt;USAMO25: 24.4 (#5/13)&lt;/li&gt;&lt;li&gt;MedCode: 50.59 (#12/75)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 33.1 (#15/21)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 63.88 (#15/54)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1540.0 (#28/34)&lt;/li&gt;&lt;li&gt;IOI: 17.08 (#29/64)&lt;/li&gt;&lt;li&gt;APEX-Agents: 17.0 (#37/45)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 41.59 (#42/53)&lt;/li&gt;&lt;li&gt;HMMT 2025: 82.5 (#43/82)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1&lt;/strong&gt; — ELO 1668, #71&lt;ul&gt;&lt;li&gt;CaseLaw v2: 73.42 (#2/54)&lt;/li&gt;&lt;li&gt;MedScribe: 88.09 (#4/74)&lt;/li&gt;&lt;li&gt;MedCode: 52.73 (#9/75)&lt;/li&gt;&lt;li&gt;Mirror, Mirror on the Wall: 52.0 (#10/44)&lt;/li&gt;&lt;li&gt;MGSM: 92.98 (#12/74)&lt;/li&gt;&lt;li&gt;Inverse Turing Bench: 67.68 (#15/40)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 55.31 (#15/53)&lt;/li&gt;&lt;li&gt;HMMT 2025: 93.33 (#22/82)&lt;/li&gt;&lt;li&gt;IOI: 21.5 (#23/64)&lt;/li&gt;&lt;li&gt;MathArena Apex: 1.04 (#39/50)&lt;/li&gt;&lt;li&gt;...and 1 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Mini&lt;/strong&gt; — ELO 1668, #72&lt;ul&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Codex CLI): 21.8 (#4/4)&lt;/li&gt;&lt;li&gt;Vision2Code: 3.85 (#4/13)&lt;/li&gt;&lt;li&gt;HarmActionsEval: 0.71 (#7/10)&lt;/li&gt;&lt;li&gt;APEX-Agents: 37.5 (#17/45)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 54.22 (#19/29)&lt;/li&gt;&lt;li&gt;Computer Anthology Terminal Tasks (Terminus-2): 4.0 (#21/22)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 45.36 (#21/40)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 53.41 (#22/53)&lt;/li&gt;&lt;li&gt;Vals Index: 52.42 (#23/40)&lt;/li&gt;&lt;li&gt;ProofBench: 21.0 (#25/54)&lt;/li&gt;&lt;li&gt;...and 8 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.20 0309&lt;/strong&gt; — ELO 1668, #73&lt;ul&gt;&lt;li&gt;IOI: 30.17 (#18/64)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 52.3 (#26/53)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 39.06 (#28/29)&lt;/li&gt;&lt;li&gt;ProofBench: 14.0 (#35/54)&lt;/li&gt;&lt;li&gt;Vals Index: 39.5 (#36/40)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 28.49 (#37/40)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 54.45 (#38/54)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 13.94 (#39/49)&lt;/li&gt;&lt;li&gt;CritPt: 6.0 (#41/213)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 11.74 (#44/46)&lt;/li&gt;&lt;li&gt;...and 4 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 (2025-04-16)&lt;/strong&gt; — ELO 1667, #75&lt;ul&gt;&lt;li&gt;MATH 500: 94.6 (#8/60)&lt;/li&gt;&lt;li&gt;MedCode: 47.29 (#21/75)&lt;/li&gt;&lt;li&gt;MGSM: 91.75 (#26/74)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1625.36 (#30/108)&lt;/li&gt;&lt;li&gt;MedScribe: 76.65 (#45/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash&lt;/strong&gt; — ELO 1666, #76&lt;ul&gt;&lt;li&gt;IMO-AnswerBench: 91.1 (#2/23)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1585.0 (#8/48)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1584.86 (#8/25)&lt;/li&gt;&lt;li&gt;AutomationBench: 18.1 (#10/10)&lt;/li&gt;&lt;li&gt;DeepsecBench: 16.54 (#12/35)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 83.03 (#25/225)&lt;/li&gt;&lt;li&gt;ALE-Bench: 324.98 (#79/89)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Glimmer 30B&lt;/strong&gt; — ELO 1665, #77&lt;ul&gt;&lt;li&gt;CPTU Bench: 4.42 (#1/102)&lt;/li&gt;&lt;li&gt;AA-LCR: 80.0 (#1/217)&lt;/li&gt;&lt;li&gt;LLM Stats (ScreenSpot Pro): 75.4 (#6/25)&lt;/li&gt;&lt;li&gt;LLM Stats (SkillsBench): 44.3 (#7/8)&lt;/li&gt;&lt;li&gt;ScreenSpot-Pro: 75.4 (#7/35)&lt;/li&gt;&lt;li&gt;LLM Stats (AIME 2026): 94.7 (#8/21)&lt;/li&gt;&lt;li&gt;WildClawBench: 47.6 (#8/21)&lt;/li&gt;&lt;li&gt;Coarena: 1002.6 (#9/16)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSearchQA): 74.6 (#9/9)&lt;/li&gt;&lt;li&gt;Coarena - Task Completion: 50.0 (#12/16)&lt;/li&gt;&lt;li&gt;...and 30 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.5&lt;/strong&gt; — ELO 1663, #79&lt;ul&gt;&lt;li&gt;FINAL Bench Metacognitive: 78.54 (#1/9)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1652.0 (#8/34)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 70.8 (#12/47)&lt;/li&gt;&lt;li&gt;ClawProBench: 58.49 (#21/57)&lt;/li&gt;&lt;li&gt;MathArena Apex: 8.85 (#25/50)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 58.73 (#28/54)&lt;/li&gt;&lt;li&gt;IOI: 17.67 (#28/64)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 50.62 (#30/53)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 15.87 (#33/49)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 28.47 (#38/46)&lt;/li&gt;&lt;li&gt;...and 7 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.20&lt;/strong&gt; — ELO 1663, #80&lt;ul&gt;&lt;li&gt;PhysicianBench: 5.3 (#12/12)&lt;/li&gt;&lt;li&gt;ClawProBench: 43.04 (#50/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5&lt;/strong&gt; — ELO 1662, #81&lt;ul&gt;&lt;li&gt;FINAL Bench Metacognitive: 76.38 (#4/9)&lt;/li&gt;&lt;li&gt;HMMT 2025: 97.5 (#6/82)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 72.8 (#8/47)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 52.9 (#14/18)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 45.3 (#17/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 47.8 (#17/18)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 50.0 (#18/18)&lt;/li&gt;&lt;li&gt;MathArena Apex: 10.94 (#22/50)&lt;/li&gt;&lt;li&gt;IOI: 22.0 (#22/64)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 53.18 (#23/53)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro (Preview 03-25)&lt;/strong&gt; — ELO 1660, #82&lt;ul&gt;&lt;li&gt;OpenEval - GPQA CoT: 74.89 (#2/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 86.3 (#4/77)&lt;/li&gt;&lt;li&gt;MATH 500: 95.2 (#5/60)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 41.6 (#15/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 83.98 (#20/77)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1517.98 (#61/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Pro&lt;/strong&gt; — ELO 1659, #83&lt;ul&gt;&lt;li&gt;ClawProBench: 57.92 (#22/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 27B&lt;/strong&gt; — ELO 1658, #84&lt;ul&gt;&lt;li&gt;CPTU Bench: 4.41 (#2/102)&lt;/li&gt;&lt;li&gt;ClawProBench: 58.74 (#20/57)&lt;/li&gt;&lt;li&gt;Android Bench: 45.1 (#29/32)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 53.16 (#41/54)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 111.0 (#42/115)&lt;/li&gt;&lt;li&gt;ProofBench: 8.0 (#44/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash Lite&lt;/strong&gt; — ELO 1657, #85&lt;ul&gt;&lt;li&gt;HarmActionsEval: 0.71 (#6/10)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1578.0 (#23/34)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 101.0 (#75/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Mini (2025-08-07)&lt;/strong&gt; — ELO 1657, #86&lt;ul&gt;&lt;li&gt;SWE-bench Verified: 59.8 (#26/47)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.1&lt;/strong&gt; — ELO 1657, #87&lt;ul&gt;&lt;li&gt;LingOly-TOO: 45.8 (#2/16)&lt;/li&gt;&lt;li&gt;Inverse Turing Bench: 60.14 (#22/40)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2 Speciale&lt;/strong&gt; — ELO 1657, #88&lt;ul&gt;&lt;li&gt;HMMT 2025: 99.2 (#3/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.1 (20250805)&lt;/strong&gt; — ELO 1657, #89&lt;ul&gt;&lt;li&gt;MGSM: 94.44 (#3/74)&lt;/li&gt;&lt;li&gt;MATH 500: 95.4 (#4/60)&lt;/li&gt;&lt;li&gt;VTB: 4.71 (#14/20)&lt;/li&gt;&lt;li&gt;EnigmaEval: 4.81 (#21/43)&lt;/li&gt;&lt;li&gt;MultiNRC: 29.67 (#22/43)&lt;/li&gt;&lt;li&gt;MedCode: 47.23 (#22/75)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 45.25 (#29/58)&lt;/li&gt;&lt;li&gt;IOI: 12.52 (#35/64)&lt;/li&gt;&lt;li&gt;MedScribe: 73.9 (#53/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Step 3.7 Flash&lt;/strong&gt; — ELO 1656, #90&lt;ul&gt;&lt;li&gt;ArxivMath: 46.67 (#14/17)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 101.0 (#71/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Solar Pro 4&lt;/strong&gt; — ELO 1650, #93&lt;ul&gt;&lt;li&gt;Agent Arena - Steerability: 13.32 (#3/48)&lt;/li&gt;&lt;li&gt;LLM Stats (AIME 2026): 95.3 (#5/21)&lt;/li&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 0.51 (#7/48)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 15.67 (#9/48)&lt;/li&gt;&lt;li&gt;Agent Arena: 10.1 (#11/48)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 13.56 (#12/48)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 8.44 (#17/48)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 57.0 (#24/28)&lt;/li&gt;&lt;li&gt;ZeroEval GPQA Diamond: 89.0 (#29/239)&lt;/li&gt;&lt;li&gt;AA GDPval: 1275.76 (#48/198)&lt;/li&gt;&lt;li&gt;...and 32 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Mini&lt;/strong&gt; — ELO 1649, #94&lt;ul&gt;&lt;li&gt;Agentick: 30.9 (#3/11)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 68.49 (#4/54)&lt;/li&gt;&lt;li&gt;MATH 500: 94.8 (#6/60)&lt;/li&gt;&lt;li&gt;MGSM: 92.58 (#15/74)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 51.93 (#28/53)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 56.2 (#29/47)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1516.0 (#30/34)&lt;/li&gt;&lt;li&gt;MedCode: 43.05 (#30/75)&lt;/li&gt;&lt;li&gt;MedScribe: 80.58 (#31/74)&lt;/li&gt;&lt;li&gt;IOI: 6.75 (#42/64)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 122B A10B&lt;/strong&gt; — ELO 1649, #95&lt;ul&gt;&lt;li&gt;CPTU Bench: 4.36 (#3/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4&lt;/strong&gt; — ELO 1648, #98&lt;ul&gt;&lt;li&gt;MGSM: 93.78 (#8/74)&lt;/li&gt;&lt;li&gt;MATH 500: 90.4 (#25/60)&lt;/li&gt;&lt;li&gt;HMMT 2025: 60.0 (#60/82)&lt;/li&gt;&lt;li&gt;AA-LCR: 33.7 (#190/217)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 31B (IT)&lt;/strong&gt; — ELO 1647, #99&lt;ul&gt;&lt;li&gt;CPTU Bench: 4.32 (#5/102)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 50.79 (#29/53)&lt;/li&gt;&lt;li&gt;Android Bench: 37.1 (#31/32)&lt;/li&gt;&lt;li&gt;ClawProBench: 51.59 (#39/57)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 52.63 (#44/54)&lt;/li&gt;&lt;li&gt;ForecastBench: 61.4 (#166/268)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5&lt;/strong&gt; — ELO 1646, #101&lt;ul&gt;&lt;li&gt;ClawProBench: 60.39 (#13/57)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 52.77 (#21/29)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 55.09 (#24/46)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 1.67 (#25/50)&lt;/li&gt;&lt;li&gt;Vals Index: 51.57 (#25/40)&lt;/li&gt;&lt;li&gt;ProofBench: 16.0 (#31/54)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 36.73 (#33/40)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 9.13 (#43/49)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 109.0 (#48/115)&lt;/li&gt;&lt;li&gt;MedScribe: 72.15 (#60/74)&lt;/li&gt;&lt;li&gt;...and 1 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.7&lt;/strong&gt; — ELO 1645, #102&lt;ul&gt;&lt;li&gt;MageBench Season 1: 1675.0 (#6/34)&lt;/li&gt;&lt;li&gt;APEX v1 Consulting: 55.7 (#12/18)&lt;/li&gt;&lt;li&gt;APEX v1 Investment Banking: 53.9 (#12/18)&lt;/li&gt;&lt;li&gt;APEX v1 Big Law: 51.6 (#17/18)&lt;/li&gt;&lt;li&gt;APEX v1 Medicine (MD): 46.7 (#18/18)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 54.88 (#37/54)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 45.98 (#38/53)&lt;/li&gt;&lt;li&gt;IOI: 7.58 (#41/64)&lt;/li&gt;&lt;li&gt;ProofBench: 6.0 (#45/54)&lt;/li&gt;&lt;li&gt;MGSM: 88.18 (#53/74)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Max&lt;/strong&gt; — ELO 1645, #103&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 28.4 (#17/21)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1594.0 (#18/34)&lt;/li&gt;&lt;li&gt;MGSM: 91.82 (#25/74)&lt;/li&gt;&lt;li&gt;IOI: 15.67 (#30/64)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 44.3 (#41/53)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 47.48 (#52/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4&lt;/strong&gt; — ELO 1644, #104&lt;ul&gt;&lt;li&gt;MATH 500: 96.2 (#2/60)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 65.81 (#9/54)&lt;/li&gt;&lt;li&gt;HMMT 2025: 95.0 (#13/82)&lt;/li&gt;&lt;li&gt;IOI: 26.17 (#19/64)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 53.51 (#21/53)&lt;/li&gt;&lt;li&gt;MGSM: 90.91 (#32/74)&lt;/li&gt;&lt;li&gt;MathArena Apex: 2.08 (#33/50)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1459.0 (#34/34)&lt;/li&gt;&lt;li&gt;MedScribe: 78.15 (#38/74)&lt;/li&gt;&lt;li&gt;MedCode: 38.08 (#47/75)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash Lite (Preview)&lt;/strong&gt; — ELO 1644, #105&lt;ul&gt;&lt;li&gt;MedCode: 47.6 (#20/75)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 41.35 (#27/29)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 54.98 (#35/54)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 46.12 (#35/53)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 29.99 (#36/40)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 0.0 (#37/50)&lt;/li&gt;&lt;li&gt;Vals Index: 36.2 (#38/40)&lt;/li&gt;&lt;li&gt;Vals AI MMLU-Pro: 86.24 (#41/132)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 8.63 (#46/46)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 3.37 (#46/49)&lt;/li&gt;&lt;li&gt;...and 2 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2&lt;/strong&gt; — ELO 1642, #107&lt;ul&gt;&lt;li&gt;CaseLaw v2: 65.7 (#10/54)&lt;/li&gt;&lt;li&gt;MATH 500: 94.2 (#10/60)&lt;/li&gt;&lt;li&gt;HMMT 2025: 93.33 (#23/82)&lt;/li&gt;&lt;li&gt;MGSM: 90.95 (#31/74)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 36.65 (#44/53)&lt;/li&gt;&lt;li&gt;ClawProBench: 47.83 (#46/57)&lt;/li&gt;&lt;li&gt;Mercor APEX: 4.1 (#48/53)&lt;/li&gt;&lt;li&gt;MathArena Apex: 0.0 (#50/50)&lt;/li&gt;&lt;li&gt;IOI: 1.25 (#61/64)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4&lt;/strong&gt; — ELO 1641, #108&lt;ul&gt;&lt;li&gt;WildAgtEval: 63.6 (#2/10)&lt;/li&gt;&lt;li&gt;MGSM: 93.02 (#11/74)&lt;/li&gt;&lt;li&gt;MATH 500: 90.32 (#26/60)&lt;/li&gt;&lt;li&gt;IOI: 6.5 (#44/64)&lt;/li&gt;&lt;li&gt;MedCode: 33.94 (#56/75)&lt;/li&gt;&lt;li&gt;MedScribe: 72.41 (#58/74)&lt;/li&gt;&lt;li&gt;CritPt: 0.3 (#146/213)&lt;/li&gt;&lt;li&gt;AA-LCR: 44.3 (#162/217)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3 Ultra&lt;/strong&gt; — ELO 1641, #109&lt;ul&gt;&lt;li&gt;Finance Agent v2: 37.67 (#32/40)&lt;/li&gt;&lt;li&gt;Vals Index: 43.99 (#33/40)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 0.42 (#35/50)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 15.38 (#36/49)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 31.73 (#37/46)&lt;/li&gt;&lt;li&gt;Mercor APEX: 11.5 (#40/53)&lt;/li&gt;&lt;li&gt;Vals AI Code Migration: 4.91 (#45/48)&lt;/li&gt;&lt;li&gt;MedCode: 38.62 (#45/75)&lt;/li&gt;&lt;li&gt;ProofBench: 2.0 (#52/54)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 107.0 (#53/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 (2024-12-17)&lt;/strong&gt; — ELO 1641, #110&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1768.81 (#4/108)&lt;/li&gt;&lt;li&gt;MATH 500: 90.4 (#24/60)&lt;/li&gt;&lt;li&gt;MGSM: 89.31 (#47/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LongCat 2.0&lt;/strong&gt; — ELO 1641, #111&lt;ul&gt;&lt;li&gt;SvelteBench: 88.9 (#73/169)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4 (20250514)&lt;/strong&gt; — ELO 1640, #112&lt;ul&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 87.5 (#2/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 61.6 (#2/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 91.77 (#3/77)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 70.85 (#4/74)&lt;/li&gt;&lt;li&gt;HELM Safety: 96.7675 (#8/59)&lt;/li&gt;&lt;li&gt;TutorBench: 45.46 (#25/27)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 27B&lt;/strong&gt; — ELO 1639, #114&lt;ul&gt;&lt;li&gt;MathArena Apex: 2.08 (#34/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Max (Preview)&lt;/strong&gt; — ELO 1639, #115&lt;ul&gt;&lt;li&gt;MGSM: 92.15 (#23/74)&lt;/li&gt;&lt;li&gt;IOI: 7.75 (#39/64)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Step 3.5 Flash&lt;/strong&gt; — ELO 1637, #117&lt;ul&gt;&lt;li&gt;HMMT 2025: 98.33 (#4/82)&lt;/li&gt;&lt;li&gt;MathArena Apex: 13.54 (#20/50)&lt;/li&gt;&lt;li&gt;ClawProBench: 41.75 (#53/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.1 Fast&lt;/strong&gt; — ELO 1636, #118&lt;ul&gt;&lt;li&gt;IDE-Bench: 35.0 (#9/15)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1637.0 (#10/34)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 60.45 (#24/54)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 52.45 (#25/53)&lt;/li&gt;&lt;li&gt;MathArena Apex: 5.21 (#29/50)&lt;/li&gt;&lt;li&gt;HMMT 2025: 90.0 (#33/82)&lt;/li&gt;&lt;li&gt;MedScribe: 78.73 (#36/74)&lt;/li&gt;&lt;li&gt;IOI: 7.67 (#40/64)&lt;/li&gt;&lt;li&gt;MGSM: 89.53 (#45/74)&lt;/li&gt;&lt;li&gt;ProofBench: 4.0 (#48/54)&lt;/li&gt;&lt;li&gt;...and 1 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O4 Mini (2025-04-16)&lt;/strong&gt; — ELO 1636, #119&lt;ul&gt;&lt;li&gt;MGSM: 93.42 (#9/74)&lt;/li&gt;&lt;li&gt;MATH 500: 94.2 (#11/60)&lt;/li&gt;&lt;li&gt;IOI: 4.83 (#48/64)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1538.33 (#55/108)&lt;/li&gt;&lt;li&gt;MedCode: 33.79 (#57/75)&lt;/li&gt;&lt;li&gt;MedScribe: 69.14 (#67/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2&lt;/strong&gt; — ELO 1635, #120&lt;ul&gt;&lt;li&gt;SWE-bench Verified: 70.0 (#14/47)&lt;/li&gt;&lt;li&gt;ClawProBench: 60.13 (#15/57)&lt;/li&gt;&lt;li&gt;Vals AI MMLU-Pro: 84.92 (#56/132)&lt;/li&gt;&lt;li&gt;Vals AI LiveCodeBench: 80.69 (#62/137)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.7 Sonnet (20250219)&lt;/strong&gt; — ELO 1635, #121&lt;ul&gt;&lt;li&gt;OpenEval - IFEval Strict: 94.0 (#1/77)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 86.0 (#5/77)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 66.0 (#10/74)&lt;/li&gt;&lt;li&gt;MGSM: 92.98 (#13/74)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 36.67 (#22/74)&lt;/li&gt;&lt;li&gt;MATH 500: 91.6 (#22/60)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1500.76 (#65/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ring-2.6-1T&lt;/strong&gt; — ELO 1634, #123&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 101.0 (#72/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.5&lt;/strong&gt; — ELO 1632, #125&lt;ul&gt;&lt;li&gt;SWE-bench Verified: 75.8 (#3/47)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 35B A3B&lt;/strong&gt; — ELO 1632, #126&lt;ul&gt;&lt;li&gt;ArxivMath: 37.5 (#16/17)&lt;/li&gt;&lt;li&gt;ClawProBench: 56.94 (#29/57)&lt;/li&gt;&lt;li&gt;Android Bench: 37.0 (#32/32)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 100.0 (#77/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4 Fast&lt;/strong&gt; — ELO 1632, #127&lt;ul&gt;&lt;li&gt;CaseLaw v2: 65.7 (#11/54)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1620.0 (#12/34)&lt;/li&gt;&lt;li&gt;HMMT 2025: 91.67 (#28/82)&lt;/li&gt;&lt;li&gt;MedScribe: 81.63 (#29/74)&lt;/li&gt;&lt;li&gt;MathArena Apex: 5.21 (#30/50)&lt;/li&gt;&lt;li&gt;MGSM: 90.87 (#34/74)&lt;/li&gt;&lt;li&gt;IOI: 11.5 (#36/64)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 46.08 (#37/53)&lt;/li&gt;&lt;li&gt;MedCode: 37.38 (#49/75)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.6&lt;/strong&gt; — ELO 1631, #128&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 35.9 (#13/21)&lt;/li&gt;&lt;li&gt;HMMT 2025: 93.33 (#24/82)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 55.4 (#31/47)&lt;/li&gt;&lt;li&gt;MGSM: 89.75 (#44/74)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 36.48 (#45/53)&lt;/li&gt;&lt;li&gt;MathArena Apex: 0.52 (#47/50)&lt;/li&gt;&lt;li&gt;IOI: 4.33 (#50/64)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KAT Coder Pro V2&lt;/strong&gt; — ELO 1631, #129&lt;ul&gt;&lt;li&gt;ClawProBench: 54.74 (#34/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1&lt;/strong&gt; — ELO 1629, #130&lt;ul&gt;&lt;li&gt;HMMT 2025: 48.33 (#62/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2 Exp&lt;/strong&gt; — ELO 1628, #131&lt;ul&gt;&lt;li&gt;CritPt: 1.4 (#83/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.7&lt;/strong&gt; — ELO 1628, #132&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 34.9 (#14/21)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 28.45 (#39/46)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 0.0 (#42/50)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 10.58 (#42/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 (2025-04-14)&lt;/strong&gt; — ELO 1626, #134&lt;ul&gt;&lt;li&gt;SWE-bench Verified: 39.6 (#38/47)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1520.39 (#60/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O4 Mini&lt;/strong&gt; — ELO 1625, #136&lt;ul&gt;&lt;li&gt;USAMO25: 19.05 (#6/13)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 21.0 (#19/21)&lt;/li&gt;&lt;li&gt;HMMT 2025: 83.33 (#41/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 235B A22B 2507&lt;/strong&gt; — ELO 1624, #139&lt;ul&gt;&lt;li&gt;WritingBench: 88.3 (#1/67)&lt;/li&gt;&lt;li&gt;MathArena Apex: 5.21 (#28/50)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 86.1 (#114/124)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Omni&lt;/strong&gt; — ELO 1624, #140&lt;ul&gt;&lt;li&gt;ClawProBench: 57.65 (#23/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash&lt;/strong&gt; — ELO 1622, #141&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 28.2 (#18/21)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1572.0 (#24/34)&lt;/li&gt;&lt;li&gt;MedScribe: 82.98 (#25/74)&lt;/li&gt;&lt;li&gt;MedCode: 40.36 (#41/75)&lt;/li&gt;&lt;li&gt;APEX-Agents: 6.4 (#43/45)&lt;/li&gt;&lt;li&gt;IOI: 2.61 (#57/64)&lt;/li&gt;&lt;li&gt;HMMT 2025: 64.17 (#58/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4 (20250514)&lt;/strong&gt; — ELO 1622, #142&lt;ul&gt;&lt;li&gt;OpenEval - Omni-MATH: 60.2 (#3/74)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 70.63 (#5/74)&lt;/li&gt;&lt;li&gt;HELM Safety: 97.4369 (#5/59)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 84.3 (#8/77)&lt;/li&gt;&lt;li&gt;MATH 500: 93.8 (#16/60)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 84.01 (#19/77)&lt;/li&gt;&lt;li&gt;WritingBench: 74.07 (#35/67)&lt;/li&gt;&lt;li&gt;MGSM: 90.87 (#36/74)&lt;/li&gt;&lt;li&gt;IOI: 4.58 (#49/64)&lt;/li&gt;&lt;li&gt;MedCode: 34.96 (#52/75)&lt;/li&gt;&lt;li&gt;...and 1 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.5&lt;/strong&gt; — ELO 1621, #143&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 36.9 (#12/21)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 54.2 (#32/47)&lt;/li&gt;&lt;li&gt;MGSM: 90.84 (#37/74)&lt;/li&gt;&lt;li&gt;MathArena Apex: 1.04 (#42/50)&lt;/li&gt;&lt;li&gt;HMMT 2025: 77.5 (#46/82)&lt;/li&gt;&lt;li&gt;IOI: 2.92 (#56/64)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KAT-Coder-Pro V1&lt;/strong&gt; — ELO 1621, #145&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 101.0 (#73/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1 0528&lt;/strong&gt; — ELO 1620, #146&lt;ul&gt;&lt;li&gt;OpenEval - GPQA CoT: 66.59 (#8/74)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 39.6 (#9/21)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 79.3 (#12/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 42.4 (#14/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 78.37 (#42/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.5&lt;/strong&gt; — ELO 1620, #147&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1767.86 (#5/108)&lt;/li&gt;&lt;li&gt;LingOly-TOO: 25.4502 (#10/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1&lt;/strong&gt; — ELO 1619, #149&lt;ul&gt;&lt;li&gt;NL2Scratch: 99.1 (#1/11)&lt;/li&gt;&lt;li&gt;Fin-RATE: 33.24 (#2/17)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 69.88 (#3/54)&lt;/li&gt;&lt;li&gt;MATH 500: 87.2 (#33/60)&lt;/li&gt;&lt;li&gt;MGSM: 87.67 (#58/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 235B A22B 2507 Instruct&lt;/strong&gt; — ELO 1619, #151&lt;ul&gt;&lt;li&gt;OpenEval - Omni-MATH: 71.83 (#1/74)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 72.65 (#3/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 84.4 (#7/77)&lt;/li&gt;&lt;li&gt;WritingBench: 85.2 (#7/67)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 83.52 (#23/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2 0905&lt;/strong&gt; — ELO 1618, #153&lt;ul&gt;&lt;li&gt;MageBench Season 1: 1558.0 (#26/34)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash (Preview 04-17)&lt;/strong&gt; — ELO 1618, #154&lt;ul&gt;&lt;li&gt;OpenEval - IFEval Strict: 89.8 (#6/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 38.45 (#20/74)&lt;/li&gt;&lt;li&gt;MATH 500: 91.8 (#20/60)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 39.01 (#32/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 63.9 (#33/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Preview&lt;/strong&gt; — ELO 1616, #155&lt;ul&gt;&lt;li&gt;LingOly-TOO: 32.2202 (#6/16)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 84.77 (#37/348)&lt;/li&gt;&lt;li&gt;AA MATH-500: 92.4 (#61/195)&lt;/li&gt;&lt;li&gt;AA AIME 2025: 79.67 (#69/270)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 76.46 (#214/575)&lt;/li&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 17.21 (#282/574)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Doubao Seed Code&lt;/strong&gt; — ELO 1616, #156&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 97.0 (#85/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.7 Sonnet&lt;/strong&gt; — ELO 1615, #157&lt;ul&gt;&lt;li&gt;LingOly-TOO: 42.8881 (#3/16)&lt;/li&gt;&lt;li&gt;USAMO25: 3.65 (#10/13)&lt;/li&gt;&lt;li&gt;HMMT 2025: 31.67 (#72/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 31B&lt;/strong&gt; — ELO 1615, #158&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 101.0 (#74/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 35B A3B&lt;/strong&gt; — ELO 1613, #161&lt;ul&gt;&lt;li&gt;MathArena Apex: 4.17 (#31/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 3 Mini Beta&lt;/strong&gt; — ELO 1613, #162&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1546.47 (#50/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 26B A4B (IT)&lt;/strong&gt; — ELO 1612, #163&lt;ul&gt;&lt;li&gt;CPTU Bench: 4.23 (#11/102)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Haiku 4.5&lt;/strong&gt; — ELO 1611, #165&lt;ul&gt;&lt;li&gt;IDE-Bench: 78.75 (#4/15)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1637.0 (#9/34)&lt;/li&gt;&lt;li&gt;HarmActionsEval: 0.0 (#10/10)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 66.6 (#18/47)&lt;/li&gt;&lt;li&gt;Inverse Turing Bench: 47.04 (#34/40)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 98.0 (#81/115)&lt;/li&gt;&lt;li&gt;PM-LLM-Benchmark: 27.7 (#126/171)&lt;/li&gt;&lt;li&gt;AA-LCR: 43.7 (#166/217)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#206/213)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Flash&lt;/strong&gt; — ELO 1610, #168&lt;ul&gt;&lt;li&gt;MageBench Season 1: 1586.0 (#21/34)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 105.0 (#57/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Sonnet (20241022)&lt;/strong&gt; — ELO 1609, #170&lt;ul&gt;&lt;li&gt;OpenEval - IFEval Strict: 85.55 (#14/77)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 77.7 (#16/77)&lt;/li&gt;&lt;li&gt;MGSM: 92.58 (#16/74)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 56.5 (#17/74)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 27.6 (#38/74)&lt;/li&gt;&lt;li&gt;MATH 500: 72.4 (#50/60)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1384.79 (#90/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Sonnet (20240620)&lt;/strong&gt; — ELO 1607, #173&lt;ul&gt;&lt;li&gt;Aider Refactoring Benchmark: 64.0 (#4/14)&lt;/li&gt;&lt;li&gt;Defects4J: 41.5 (#9/35)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 85.98 (#12/77)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 73.34 (#21/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 3&lt;/strong&gt; — ELO 1607, #174&lt;ul&gt;&lt;li&gt;USAMO25: 4.76 (#8/13)&lt;/li&gt;&lt;li&gt;MATH 500: 89.8 (#27/60)&lt;/li&gt;&lt;li&gt;MGSM: 91.35 (#29/74)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1545.77 (#51/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok Code Fast 1&lt;/strong&gt; — ELO 1605, #176&lt;ul&gt;&lt;li&gt;IDE-Bench: 11.25 (#12/15)&lt;/li&gt;&lt;li&gt;IOI: 4.33 (#51/64)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Next 80B A3B&lt;/strong&gt; — ELO 1603, #178&lt;ul&gt;&lt;li&gt;OpenEval - Omni-MATH: 46.68 (#11/74)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 63.0 (#12/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 78.6 (#13/77)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 80.96 (#35/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Medium 3.5&lt;/strong&gt; — ELO 1603, #179&lt;ul&gt;&lt;li&gt;Vals AI ProofBench: 9.0 (#22/24)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 34.77 (#29/29)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 32.1 (#34/40)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 0.42 (#36/50)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 46.11 (#36/53)&lt;/li&gt;&lt;li&gt;Vals Index: 37.81 (#37/40)&lt;/li&gt;&lt;li&gt;ProofBench: 10.0 (#39/54)&lt;/li&gt;&lt;li&gt;Vals AI Legal Research Bench: 9.13 (#44/49)&lt;/li&gt;&lt;li&gt;Vals AI Code Migration: 5.13 (#44/48)&lt;/li&gt;&lt;li&gt;Vals AI Excel Modeling: 11.19 (#45/46)&lt;/li&gt;&lt;li&gt;...and 4 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash Lite (Preview 09-2025)&lt;/strong&gt; — ELO 1602, #180&lt;ul&gt;&lt;li&gt;MGSM: 89.53 (#46/74)&lt;/li&gt;&lt;li&gt;MedScribe: 75.82 (#50/74)&lt;/li&gt;&lt;li&gt;MedCode: 34.19 (#54/75)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ling-2.6-1T&lt;/strong&gt; — ELO 1602, #181&lt;ul&gt;&lt;li&gt;ClawProBench: 57.4 (#25/57)&lt;/li&gt;&lt;li&gt;SvelteBench: 68.9 (#132/169)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Sonnet&lt;/strong&gt; — ELO 1601, #182&lt;ul&gt;&lt;li&gt;LingOly-TOO: 28.1014 (#8/16)&lt;/li&gt;&lt;li&gt;ZEROBench-Sub: 20.71 (#26/46)&lt;/li&gt;&lt;li&gt;HMMT 2025: 1.67 (#82/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Nano&lt;/strong&gt; — ELO 1601, #183&lt;ul&gt;&lt;li&gt;Vals Multimodal Index: 47.64 (#24/29)&lt;/li&gt;&lt;li&gt;Vals AI Code Migration: 14.47 (#30/48)&lt;/li&gt;&lt;li&gt;APEX-Agents: 25.5 (#30/45)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 38.22 (#30/40)&lt;/li&gt;&lt;li&gt;Vals Index: 46.63 (#31/40)&lt;/li&gt;&lt;li&gt;LiveBench: 71.31 (#32/48)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 47.8 (#32/53)&lt;/li&gt;&lt;li&gt;IOI: 15.25 (#32/64)&lt;/li&gt;&lt;li&gt;MedCode: 41.03 (#36/75)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 0.0 (#40/50)&lt;/li&gt;&lt;li&gt;...and 5 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;InternVL3-78B&lt;/strong&gt; — ELO 1597, #186&lt;ul&gt;&lt;li&gt;RealWorldQA: 78.0 (#7/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2&lt;/strong&gt; — ELO 1597, #187&lt;ul&gt;&lt;li&gt;SWE-bench Verified: 61.0 (#24/47)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Trinity Large&lt;/strong&gt; — ELO 1597, #188&lt;ul&gt;&lt;li&gt;CaseLaw v2: 57.88 (#29/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 Mini&lt;/strong&gt; — ELO 1596, #189&lt;ul&gt;&lt;li&gt;LingOly-TOO: 30.5909 (#7/16)&lt;/li&gt;&lt;li&gt;USAMO25: 2.08 (#13/13)&lt;/li&gt;&lt;li&gt;HMMT 2025: 67.5 (#55/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 405B&lt;/strong&gt; — ELO 1596, #190&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1755.81 (#7/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Medium 3.1&lt;/strong&gt; — ELO 1595, #193&lt;ul&gt;&lt;li&gt;MageBench Season 1: 1569.0 (#25/34)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 235B A22B&lt;/strong&gt; — ELO 1595, #194&lt;ul&gt;&lt;li&gt;MATH 500: 94.6 (#9/60)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1594.0 (#17/34)&lt;/li&gt;&lt;li&gt;MGSM: 92.47 (#17/74)&lt;/li&gt;&lt;li&gt;HMMT 2025: 62.5 (#59/82)&lt;/li&gt;&lt;li&gt;IOI: 0.0 (#64/64)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mercury 2&lt;/strong&gt; — ELO 1595, #195&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 99.0 (#80/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3 Super&lt;/strong&gt; — ELO 1593, #198&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 103.0 (#64/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen3 Coder Next&lt;/strong&gt; — ELO 1592, #199&lt;ul&gt;&lt;li&gt;ClawProBench: 46.84 (#48/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o&lt;/strong&gt; — ELO 1591, #201&lt;ul&gt;&lt;li&gt;ComplexFuncBench: 66.5 (#1/18)&lt;/li&gt;&lt;li&gt;LingOly-TOO: 15.6334 (#12/16)&lt;/li&gt;&lt;li&gt;HMMT 2025: 5.83 (#81/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3.5 Lightning&lt;/strong&gt; — ELO 1591, #202&lt;ul&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 24.58 (#28/28)&lt;/li&gt;&lt;li&gt;LLM Stats (BrowseComp): 36.97 (#56/62)&lt;/li&gt;&lt;li&gt;OpenRouter GPQA Diamond: 68.2 (#84/114)&lt;/li&gt;&lt;li&gt;ZeroEval GPQA Diamond: 75.44 (#107/239)&lt;/li&gt;&lt;li&gt;SpeechMap Compliance: 75.0 (#114/367)&lt;/li&gt;&lt;li&gt;AA GDPval: 823.59 (#117/198)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 8.87 (#118/166)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 752.0 (#121/313)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Continuation): 553.0 (#138/258)&lt;/li&gt;&lt;li&gt;SvelteBench: 55.6 (#141/169)&lt;/li&gt;&lt;li&gt;...and 30 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-OSS-120B&lt;/strong&gt; — ELO 1590, #203&lt;ul&gt;&lt;li&gt;FINAL Bench Metacognitive: 73.33 (#7/9)&lt;/li&gt;&lt;li&gt;MATH 500: 94.8 (#7/60)&lt;/li&gt;&lt;li&gt;MGSM: 92.04 (#24/74)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1516.0 (#31/34)&lt;/li&gt;&lt;li&gt;HMMT 2025: 90.0 (#32/82)&lt;/li&gt;&lt;li&gt;MathArena Apex: 1.04 (#44/50)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 21.54 (#47/53)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 48.77 (#50/54)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 105.0 (#58/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 3 Mini&lt;/strong&gt; — ELO 1590, #204&lt;ul&gt;&lt;li&gt;HMMT 2025: 74.17 (#50/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 Mini (2025-01-31)&lt;/strong&gt; — ELO 1590, #205&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1684.99 (#18/108)&lt;/li&gt;&lt;li&gt;MATH 500: 91.8 (#19/60)&lt;/li&gt;&lt;li&gt;MGSM: 91.35 (#28/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 Mini&lt;/strong&gt; — ELO 1588, #207&lt;ul&gt;&lt;li&gt;MATH 500: 88.0 (#31/60)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 23.9 (#42/47)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1547.62 (#49/108)&lt;/li&gt;&lt;li&gt;MGSM: 87.78 (#57/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 3&lt;/strong&gt; — ELO 1588, #208&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 89.0 (#103/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM 4.5 Air&lt;/strong&gt; — ELO 1587, #211&lt;ul&gt;&lt;li&gt;HMMT 2025: 69.17 (#53/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3 (0324)&lt;/strong&gt; — ELO 1587, #212&lt;ul&gt;&lt;li&gt;MGSM: 91.67 (#27/74)&lt;/li&gt;&lt;li&gt;MATH 500: 88.6 (#30/60)&lt;/li&gt;&lt;li&gt;IOI: 1.67 (#60/64)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;INTELLECT-3&lt;/strong&gt; — ELO 1587, #213&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 94.0 (#95/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 12B&lt;/strong&gt; — ELO 1586, #215&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 98.0 (#82/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 4 Maverick&lt;/strong&gt; — ELO 1584, #218&lt;ul&gt;&lt;li&gt;IDE-Bench: 2.5 (#14/15)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1590.0 (#19/34)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1473.88 (#73/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.0 Flash&lt;/strong&gt; — ELO 1584, #219&lt;ul&gt;&lt;li&gt;USAMO25: 4.17 (#9/13)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1701.95 (#15/108)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 13.5 (#45/47)&lt;/li&gt;&lt;li&gt;HMMT 2025: 35.83 (#67/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 72B Instruct&lt;/strong&gt; — ELO 1583, #222&lt;ul&gt;&lt;li&gt;OpenEval - IFEval Strict: 89.93 (#5/77)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 69.31 (#26/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.0 Flash (001)&lt;/strong&gt; — ELO 1583, #223&lt;ul&gt;&lt;li&gt;OpenEval - Omni-MATH: 45.9 (#12/74)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 55.61 (#18/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 84.07 (#18/77)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 73.7 (#20/77)&lt;/li&gt;&lt;li&gt;MATH 500: 88.0 (#32/60)&lt;/li&gt;&lt;li&gt;MGSM: 89.02 (#50/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Magistral Medium 1.2&lt;/strong&gt; — ELO 1583, #225&lt;ul&gt;&lt;li&gt;IOI: 0.67 (#62/64)&lt;/li&gt;&lt;li&gt;MGSM: 74.62 (#71/74)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 94.0 (#93/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o (2024-11-20)&lt;/strong&gt; — ELO 1582, #228&lt;ul&gt;&lt;li&gt;CaseLaw v2: 59.7 (#25/54)&lt;/li&gt;&lt;li&gt;MGSM: 90.36 (#40/74)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 21.6 (#43/47)&lt;/li&gt;&lt;li&gt;MATH 500: 74.0 (#47/60)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 9B&lt;/strong&gt; — ELO 1580, #234&lt;ul&gt;&lt;li&gt;RealWorldQA: 80.3 (#5/12)&lt;/li&gt;&lt;li&gt;MathArena Apex: 0.52 (#49/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 405B Instruct&lt;/strong&gt; — ELO 1580, #235&lt;ul&gt;&lt;li&gt;MATH 500: 71.4 (#51/60)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1&lt;/strong&gt; — ELO 1579, #240&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1718.73 (#14/108)&lt;/li&gt;&lt;li&gt;MATH 500: 92.2 (#18/60)&lt;/li&gt;&lt;li&gt;MGSM: 92.25 (#20/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3&lt;/strong&gt; — ELO 1579, #241&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1732.54 (#11/108)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 40.27 (#17/74)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 53.81 (#19/74)&lt;/li&gt;&lt;li&gt;MGSM: 92.15 (#21/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 72.3 (#24/77)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 83.24 (#25/77)&lt;/li&gt;&lt;li&gt;MATH 500: 80.4 (#38/60)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o (2024-08-06)&lt;/strong&gt; — ELO 1576, #242&lt;ul&gt;&lt;li&gt;Aider Refactoring Benchmark: 49.4 (#8/14)&lt;/li&gt;&lt;li&gt;Defects4J: 34.1 (#15/35)&lt;/li&gt;&lt;li&gt;MGSM: 90.69 (#38/74)&lt;/li&gt;&lt;li&gt;MATH 500: 75.2 (#45/60)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 8.06 (#49/53)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Nano&lt;/strong&gt; — ELO 1575, #245&lt;ul&gt;&lt;li&gt;CommunityFact: 75.59 (#3/17)&lt;/li&gt;&lt;li&gt;RealWorldQA: 71.8 (#11/12)&lt;/li&gt;&lt;li&gt;MATH 500: 93.8 (#15/60)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1499.0 (#33/34)&lt;/li&gt;&lt;li&gt;ProofBench: 12.0 (#37/54)&lt;/li&gt;&lt;li&gt;SWE-bench Verified: 34.8 (#39/47)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 52.63 (#43/54)&lt;/li&gt;&lt;li&gt;MGSM: 89.31 (#48/74)&lt;/li&gt;&lt;li&gt;MedScribe: 72.86 (#55/74)&lt;/li&gt;&lt;li&gt;MedCode: 30.44 (#67/75)&lt;/li&gt;&lt;li&gt;...and 1 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Pro (002)&lt;/strong&gt; — ELO 1573, #249&lt;ul&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 73.7 (#19/77)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 53.36 (#20/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 83.67 (#22/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 36.4 (#23/74)&lt;/li&gt;&lt;li&gt;MATH 500: 82.8 (#37/60)&lt;/li&gt;&lt;li&gt;MGSM: 89.2 (#49/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 4 Maverick Instruct&lt;/strong&gt; — ELO 1573, #250&lt;ul&gt;&lt;li&gt;MedCode: 36.51 (#51/75)&lt;/li&gt;&lt;li&gt;MedScribe: 54.22 (#73/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o (2024-05-13)&lt;/strong&gt; — ELO 1572, #251&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1825.22 (#1/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Haiku 4.5 (20251001)&lt;/strong&gt; — ELO 1571, #252&lt;ul&gt;&lt;li&gt;OpenEval - Omni-MATH: 56.1 (#4/74)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 60.54 (#15/74)&lt;/li&gt;&lt;li&gt;MedScribe: 85.23 (#16/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 77.7 (#17/77)&lt;/li&gt;&lt;li&gt;MGSM: 92.15 (#22/74)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 42.88 (#26/29)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 56.48 (#30/54)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 0.83 (#32/50)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 46.93 (#34/53)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 31.01 (#35/40)&lt;/li&gt;&lt;li&gt;...and 6 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash Lite&lt;/strong&gt; — ELO 1570, #255&lt;ul&gt;&lt;li&gt;OpenEval - Omni-MATH: 47.97 (#10/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 81.02 (#34/77)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 53.7 (#43/77)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 30.94 (#47/74)&lt;/li&gt;&lt;li&gt;MedScribe: 72.83 (#56/74)&lt;/li&gt;&lt;li&gt;MedCode: 27.11 (#71/75)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small 4&lt;/strong&gt; — ELO 1568, #257&lt;ul&gt;&lt;li&gt;ClawProBench: 45.26 (#49/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Devstral Small 2&lt;/strong&gt; — ELO 1566, #260&lt;ul&gt;&lt;li&gt;SWE-bench Verified: 56.4 (#28/47)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Pro&lt;/strong&gt; — ELO 1564, #265&lt;ul&gt;&lt;li&gt;PhysicsFinals: 63.9 (#1/34)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1782.7 (#2/108)&lt;/li&gt;&lt;li&gt;Natural2Code: 85.4 (#2/31)&lt;/li&gt;&lt;li&gt;LingOly-TOO: 20.4615 (#11/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 70B Instruct&lt;/strong&gt; — ELO 1561, #269&lt;ul&gt;&lt;li&gt;MATH 500: 65.0 (#56/60)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Magistral Small 1.2&lt;/strong&gt; — ELO 1561, #271&lt;ul&gt;&lt;li&gt;MGSM: 86.25 (#62/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 VL 30B A3B&lt;/strong&gt; — ELO 1561, #272&lt;ul&gt;&lt;li&gt;RealWorldQA: 77.4 (#8/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 2 (Nov) Instruct (2411)&lt;/strong&gt; — ELO 1560, #276&lt;ul&gt;&lt;li&gt;MATH 500: 74.4 (#46/60)&lt;/li&gt;&lt;li&gt;MGSM: 87.24 (#60/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 30B A3B 2507&lt;/strong&gt; — ELO 1560, #278&lt;ul&gt;&lt;li&gt;MathArena Apex: 0.52 (#48/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Command A+&lt;/strong&gt; — ELO 1560, #280&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 89.0 (#105/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 2 (1212)&lt;/strong&gt; — ELO 1558, #281&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1758.36 (#6/108)&lt;/li&gt;&lt;li&gt;MATH 500: 78.4 (#42/60)&lt;/li&gt;&lt;li&gt;MGSM: 86.15 (#64/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 30B A3B&lt;/strong&gt; — ELO 1556, #286&lt;ul&gt;&lt;li&gt;HMMT 2025: 50.83 (#61/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 Turbo&lt;/strong&gt; — ELO 1553, #294&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1781.47 (#3/108)&lt;/li&gt;&lt;li&gt;Aider Refactoring Benchmark: 34.1 (#10/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;jamba-large-1.7&lt;/strong&gt; — ELO 1550, #304&lt;ul&gt;&lt;li&gt;Finance Agent v1.1: 0.37 (#52/53)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.3 70B&lt;/strong&gt; — ELO 1547, #311&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1746.41 (#9/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.3 70B Instruct&lt;/strong&gt; — ELO 1546, #313&lt;ul&gt;&lt;li&gt;LingOly-TOO: 8.2131 (#15/16)&lt;/li&gt;&lt;li&gt;MGSM: 91.09 (#30/74)&lt;/li&gt;&lt;li&gt;MATH 500: 73.4 (#48/60)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nova Pro (v1)&lt;/strong&gt; — ELO 1546, #314&lt;ul&gt;&lt;li&gt;OpenEval - GPQA CoT: 44.62 (#26/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 67.3 (#28/77)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 81.55 (#33/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 24.22 (#39/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 4 Scout Instruct&lt;/strong&gt; — ELO 1546, #315&lt;ul&gt;&lt;li&gt;MATH 500: 79.2 (#40/60)&lt;/li&gt;&lt;li&gt;MGSM: 87.96 (#55/74)&lt;/li&gt;&lt;li&gt;MedCode: 23.31 (#74/75)&lt;/li&gt;&lt;li&gt;MedScribe: 50.59 (#74/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 Preview (0125)&lt;/strong&gt; — ELO 1545, #319&lt;ul&gt;&lt;li&gt;Aider Refactoring Benchmark: 33.7 (#11/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Yi 1.5 34B&lt;/strong&gt; — ELO 1540, #332&lt;ul&gt;&lt;li&gt;PhysicsFinals: 17.4 (#17/34)&lt;/li&gt;&lt;li&gt;EHRBench: 58.94 (#18/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;QwQ-32B&lt;/strong&gt; — ELO 1538, #335&lt;ul&gt;&lt;li&gt;USAMO25: 2.98 (#11/13)&lt;/li&gt;&lt;li&gt;HMMT 2025: 47.5 (#63/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 4B&lt;/strong&gt; — ELO 1536, #340&lt;ul&gt;&lt;li&gt;RealWorldQA: 79.5 (#6/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-OSS-20B&lt;/strong&gt; — ELO 1535, #342&lt;ul&gt;&lt;li&gt;MATH 500: 94.2 (#13/60)&lt;/li&gt;&lt;li&gt;HMMT 2025: 76.67 (#47/82)&lt;/li&gt;&lt;li&gt;MGSM: 89.02 (#51/74)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 43.84 (#54/54)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 100.0 (#78/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 4 Scout&lt;/strong&gt; — ELO 1535, #343&lt;ul&gt;&lt;li&gt;IDE-Bench: 2.5 (#13/15)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1500.45 (#66/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4&lt;/strong&gt; — ELO 1531, #351&lt;ul&gt;&lt;li&gt;AA Omniscience - Business: 21.1 (#155/479)&lt;/li&gt;&lt;li&gt;AA MATH-500: 56.8 (#159/195)&lt;/li&gt;&lt;li&gt;AA Omniscience - Law: 16.5 (#164/479)&lt;/li&gt;&lt;li&gt;AA Omniscience - Software Engineering (SWE) - Julia: 20.0 (#172/479)&lt;/li&gt;&lt;li&gt;AA GDPval: 238.72 (#174/198)&lt;/li&gt;&lt;li&gt;AA Omniscience - Humanities &amp; Social Sciences: 23.6 (#180/479)&lt;/li&gt;&lt;li&gt;AA Omniscience: -33.83 (#207/479)&lt;/li&gt;&lt;li&gt;AA Omniscience - Health: 21.7 (#211/479)&lt;/li&gt;&lt;li&gt;AA Omniscience - Software Engineering (SWE) - R: 14.0 (#216/479)&lt;/li&gt;&lt;li&gt;AA-Omniscience Accuracy: 21.0 (#222/479)&lt;/li&gt;&lt;li&gt;...and 18 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Falcon-H1R-7B&lt;/strong&gt; — ELO 1530, #356&lt;ul&gt;&lt;li&gt;HMMT 2025: 84.17 (#39/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Flash (002)&lt;/strong&gt; — ELO 1526, #360&lt;ul&gt;&lt;li&gt;OpenEval - IFEval Strict: 83.12 (#26/77)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 43.72 (#27/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 67.8 (#27/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 30.45 (#31/74)&lt;/li&gt;&lt;li&gt;MATH 500: 78.8 (#41/60)&lt;/li&gt;&lt;li&gt;MGSM: 86.58 (#61/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large&lt;/strong&gt; — ELO 1526, #363&lt;ul&gt;&lt;li&gt;MageBench Season 1: 1501.0 (#32/34)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Flash&lt;/strong&gt; — ELO 1523, #370&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1668.98 (#25/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 4B 2507&lt;/strong&gt; — ELO 1523, #371&lt;ul&gt;&lt;li&gt;MathArena Apex: 2.08 (#36/50)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 (0613)&lt;/strong&gt; — ELO 1523, #372&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1747.59 (#8/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ling-2.6-flash&lt;/strong&gt; — ELO 1523, #373&lt;ul&gt;&lt;li&gt;ClawProBench: 27.04 (#57/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Mini (2024-09-12)&lt;/strong&gt; — ELO 1521, #375&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1626.65 (#29/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 27B&lt;/strong&gt; — ELO 1518, #378&lt;ul&gt;&lt;li&gt;BIG-Bench Extra Hard: 19.3 (#8/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;QwQ 32B-Preview&lt;/strong&gt; — ELO 1514, #383&lt;ul&gt;&lt;li&gt;HMMT 2025: 18.33 (#76/82)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o Mini (2024-07-18)&lt;/strong&gt; — ELO 1511, #387&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1674.64 (#23/108)&lt;/li&gt;&lt;li&gt;MATH 500: 72.6 (#49/60)&lt;/li&gt;&lt;li&gt;MGSM: 86.18 (#63/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o Mini&lt;/strong&gt; — ELO 1508, #394&lt;ul&gt;&lt;li&gt;NL2Scratch: 78.0 (#11/11)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 6.7 (#21/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-4&lt;/strong&gt; — ELO 1508, #395&lt;ul&gt;&lt;li&gt;LingOly-TOO: 10.9966 (#14/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Granite 4.0 H Small&lt;/strong&gt; — ELO 1504, #400&lt;ul&gt;&lt;li&gt;OpenEval - IFEval Strict: 88.97 (#7/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 29.57 (#34/74)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 38.34 (#35/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 56.9 (#39/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nova Lite (v1)&lt;/strong&gt; — ELO 1503, #403&lt;ul&gt;&lt;li&gt;OpenEval - GPQA CoT: 39.69 (#31/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 60.0 (#37/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 23.3 (#40/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 77.6 (#45/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;aya-23-35B&lt;/strong&gt; — ELO 1494, #418&lt;ul&gt;&lt;li&gt;LingOly-TOO: 5.7082 (#16/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Haiku (20241022)&lt;/strong&gt; — ELO 1493, #420&lt;ul&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 60.5 (#36/77)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 36.32 (#39/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 79.17 (#40/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 22.4 (#42/74)&lt;/li&gt;&lt;li&gt;MATH 500: 64.2 (#57/60)&lt;/li&gt;&lt;li&gt;MGSM: 84.62 (#68/74)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1413.9 (#85/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 12B&lt;/strong&gt; — ELO 1491, #426&lt;ul&gt;&lt;li&gt;BIG-Bench Extra Hard: 16.3 (#9/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Yi 1.5 34B Chat&lt;/strong&gt; — ELO 1481, #441&lt;ul&gt;&lt;li&gt;INVESTORBENCH: 37.97 (#5/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4 9B Chat&lt;/strong&gt; — ELO 1476, #446&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1616.51 (#33/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 Nano&lt;/strong&gt; — ELO 1474, #449&lt;ul&gt;&lt;li&gt;MATH 500: 80.2 (#39/60)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1533.06 (#58/108)&lt;/li&gt;&lt;li&gt;MGSM: 69.27 (#73/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E4B&lt;/strong&gt; — ELO 1472, #451&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 93.0 (#99/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Yi-1.5-9B&lt;/strong&gt; — ELO 1470, #457&lt;ul&gt;&lt;li&gt;EHRBench: 45.51 (#27/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 2B&lt;/strong&gt; — ELO 1469, #459&lt;ul&gt;&lt;li&gt;ArxivMath: 10.62 (#17/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral 3 3B&lt;/strong&gt; — ELO 1469, #460&lt;ul&gt;&lt;li&gt;HarmActionsEval: 2.13 (#5/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Command-R+&lt;/strong&gt; — ELO 1469, #461&lt;ul&gt;&lt;li&gt;IDE-Bench: 0.0 (#15/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-3.5 Turbo&lt;/strong&gt; — ELO 1464, #470&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 14.0 (#20/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small (2402)&lt;/strong&gt; — ELO 1457, #482&lt;ul&gt;&lt;li&gt;MATH 500: 70.6 (#53/60)&lt;/li&gt;&lt;li&gt;MGSM: 83.96 (#70/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Granite 4.0 Micro&lt;/strong&gt; — ELO 1455, #489&lt;ul&gt;&lt;li&gt;OpenEval - IFEval Strict: 84.87 (#17/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 20.93 (#45/74)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 30.72 (#50/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 39.5 (#53/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 8B Instruct&lt;/strong&gt; — ELO 1453, #494&lt;ul&gt;&lt;li&gt;MATH 500: 44.4 (#59/60)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-3.5 Turbo (0301)&lt;/strong&gt; — ELO 1449, #501&lt;ul&gt;&lt;li&gt;HELM: 76.03 (#13/66)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Yi-1.5-9B Chat&lt;/strong&gt; — ELO 1444, #514&lt;ul&gt;&lt;li&gt;INVESTORBENCH: 22.91 (#12/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OLMo-2-1124-7B-Instruct&lt;/strong&gt; — ELO 1436, #525&lt;ul&gt;&lt;li&gt;OpenEval - GPQA CoT: 29.6 (#52/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 69.29 (#54/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 11.63 (#56/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 29.2 (#57/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E2B&lt;/strong&gt; — ELO 1434, #530&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 86.0 (#106/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-3.5 Turbo (0125)&lt;/strong&gt; — ELO 1424, #548&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1560.51 (#44/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 4B&lt;/strong&gt; — ELO 1409, #570&lt;ul&gt;&lt;li&gt;BIG-Bench Extra Hard: 11.0 (#11/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-4 Mini Instruct&lt;/strong&gt; — ELO 1401, #578&lt;ul&gt;&lt;li&gt;HarmActionsEval: 2.84 (#3/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Yi 6B (Base)&lt;/strong&gt; — ELO 1335, #653&lt;ul&gt;&lt;li&gt;BBH: 47.2 (#15/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Mythos 5&lt;/strong&gt; — ELO 1809&lt;ul&gt;&lt;li&gt;OSWorld-Verified: 85.0 (#1/27)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash (0423)&lt;/strong&gt; — ELO 1669&lt;ul&gt;&lt;li&gt;LLM Stats (CodeForces): 93.87 (#3/17)&lt;/li&gt;&lt;li&gt;LLM Stats (MathArena Apex): 72.1 (#3/8)&lt;/li&gt;&lt;li&gt;LLM Stats (CSimpleQA): 73.2 (#7/8)&lt;/li&gt;&lt;li&gt;LLM Stats (HMMT Feb 26): 91.9 (#7/12)&lt;/li&gt;&lt;li&gt;LLM Stats (IMO-AnswerBench): 85.1 (#10/20)&lt;/li&gt;&lt;li&gt;LLM Stats (MCP Atlas): 67.4 (#23/33)&lt;/li&gt;&lt;li&gt;LLM Stats (Toolathlon): 43.5 (#27/37)&lt;/li&gt;&lt;li&gt;LLM Stats (BrowseComp): 53.5 (#41/62)&lt;/li&gt;&lt;li&gt;ZeroEval GPQA Diamond: 87.4 (#43/239)&lt;/li&gt;&lt;li&gt;LLM Stats Score: 36.8 (#64/341)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro Preview&lt;/strong&gt; — ELO 1676&lt;ul&gt;&lt;li&gt;GDPevo: 43.58 (#4/4)&lt;/li&gt;&lt;li&gt;Creative Writing (Lechmazur): 0.0 (#22/44)&lt;/li&gt;&lt;li&gt;Multi-turn Debate (Lechmazur): 1471.8 (#28/46)&lt;/li&gt;&lt;li&gt;NYT Connections Extended: 59.9 (#53/104)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Doubao-Seed-1.6&lt;/strong&gt; — ELO 1635&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 37.3 (#10/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ERNIE 5.0&lt;/strong&gt; — ELO 1609&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 94.0 (#96/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; — ELO 1778&lt;ul&gt;&lt;li&gt;LLM Stats (AutomationBench): 48.2 (#1/12)&lt;/li&gt;&lt;li&gt;LLM Stats (CyberGym): 84.5 (#1/13)&lt;/li&gt;&lt;li&gt;LLM Stats (PostTrainBench): 39.8 (#1/6)&lt;/li&gt;&lt;li&gt;FrontierSWE: 78.0 (#2/17)&lt;/li&gt;&lt;li&gt;LLM Stats (NL2Repo): 58.0 (#2/17)&lt;/li&gt;&lt;li&gt;LLM Stats (FrontierSWE): 78.1 (#3/16)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 88.2 (#3/28)&lt;/li&gt;&lt;li&gt;LLM Stats (Toolathlon): 73.0 (#4/37)&lt;/li&gt;&lt;li&gt;Vending-Bench 2: 8163.61 (#6/60)&lt;/li&gt;&lt;li&gt;LLM Stats (Program Bench): 19.0 (#6/6)&lt;/li&gt;&lt;li&gt;...and 5 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 Turbo (Preview)&lt;/strong&gt; — ELO 1538&lt;ul&gt;&lt;li&gt;Natural2Code: 51.5 (#11/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Codex Max&lt;/strong&gt; — ELO 1686&lt;ul&gt;&lt;li&gt;IDE-Bench: 73.75 (#5/15)&lt;/li&gt;&lt;li&gt;ALE-Bench: 1228.25 (#12/89)&lt;/li&gt;&lt;li&gt;IOI: 21.42 (#24/64)&lt;/li&gt;&lt;li&gt;LiveBench: 72.39 (#29/48)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 9.0 (#40/52)&lt;/li&gt;&lt;li&gt;ProofBench: 9.0 (#41/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Instant&lt;/strong&gt; — ELO 1666&lt;ul&gt;&lt;li&gt;Arena AI Document: 1402.0 (#36/38)&lt;/li&gt;&lt;li&gt;FrontierMath - Tiers 1-3 (v2): 26.32 (#42/48)&lt;/li&gt;&lt;li&gt;FrontierMath - Tier 4 (v2): 2.44 (#43/50)&lt;/li&gt;&lt;li&gt;SimpleQA Verified: 38.0 (#45/77)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 12.0 (#116/161)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 68.06 (#128/238)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.0 Flash Lite (Preview 02-05)&lt;/strong&gt; — ELO 1528&lt;ul&gt;&lt;li&gt;OpenEval - Omni-MATH: 37.37 (#21/74)&lt;/li&gt;&lt;li&gt;OpenEval - GPQA CoT: 50.0 (#23/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 72.0 (#25/77)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 82.44 (#29/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash (Preview 09-2025)&lt;/strong&gt; — ELO 1646&lt;ul&gt;&lt;li&gt;MedScribe: 78.5 (#37/74)&lt;/li&gt;&lt;li&gt;MedCode: 40.54 (#39/75)&lt;/li&gt;&lt;li&gt;MGSM: 89.85 (#43/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3n E2B Instructed LiteRT (Preview)&lt;/strong&gt; — ELO 1392&lt;ul&gt;&lt;li&gt;ECLeKTic: 2.5 (#12/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3n E4B Instructed LiteRT Preview&lt;/strong&gt; — ELO 1423&lt;ul&gt;&lt;li&gt;ECLeKTic: 1.9 (#14/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 26B&lt;/strong&gt; — ELO 1601&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 96.0 (#90/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok Beta&lt;/strong&gt; — ELO 1543&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1741.94 (#10/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna M.1&lt;/strong&gt; — ELO 1574&lt;ul&gt;&lt;li&gt;Finance Agent v2: 25.03 (#39/40)&lt;/li&gt;&lt;li&gt;Vals Index: 33.33 (#39/40)&lt;/li&gt;&lt;li&gt;ProofBench: 0.0 (#54/54)&lt;/li&gt;&lt;li&gt;MedCode: 25.24 (#73/75)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 84.0 (#108/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna S 2.1&lt;/strong&gt; — ELO 1658&lt;ul&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 70.2 (#19/28)&lt;/li&gt;&lt;li&gt;LLM Stats (Toolathlon): 49.7 (#19/37)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSWE 1.1): 40.4 (#21/25)&lt;/li&gt;&lt;li&gt;LLM Stats Score: 41.9 (#40/341)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna XS.2&lt;/strong&gt; — ELO 1548&lt;ul&gt;&lt;li&gt;Finance Agent v2: 15.6 (#40/40)&lt;/li&gt;&lt;li&gt;Vals Index: 30.04 (#40/40)&lt;/li&gt;&lt;li&gt;ProofBench: 0.0 (#53/54)&lt;/li&gt;&lt;li&gt;MedCode: 20.7 (#75/75)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 85.0 (#107/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LongCat-Flash-Chat&lt;/strong&gt; — ELO 1574&lt;ul&gt;&lt;li&gt;VitaBench 2.0: 29.8 (#16/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LongCat-Flash-Thinking-2601&lt;/strong&gt; — ELO 1636&lt;ul&gt;&lt;li&gt;ClawProBench: 57.48 (#24/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark&lt;/strong&gt; — ELO 1731&lt;ul&gt;&lt;li&gt;Finance Agent v1.1: 60.59 (#4/53)&lt;/li&gt;&lt;li&gt;LMArena Text Arena: 1487.95 (#11/24)&lt;/li&gt;&lt;li&gt;MedCode: 51.31 (#11/75)&lt;/li&gt;&lt;li&gt;MedScribe: 85.9 (#11/74)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 63.13 (#17/54)&lt;/li&gt;&lt;li&gt;ProofBench: 17.0 (#30/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Preview (2024-09-12)&lt;/strong&gt; — ELO 1584&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1622.24 (#31/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Pro&lt;/strong&gt; — ELO 1624&lt;ul&gt;&lt;li&gt;USAMO25: 2.83 (#12/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Palmyra Fin&lt;/strong&gt; — ELO 1566&lt;ul&gt;&lt;li&gt;OpenEval - GPQA CoT: 42.15 (#28/74)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 29.47 (#35/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 59.1 (#38/77)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 79.3 (#39/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Palmyra Med&lt;/strong&gt; — ELO 1482&lt;ul&gt;&lt;li&gt;OpenEval - GPQA CoT: 36.77 (#37/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 76.74 (#46/77)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 41.1 (#48/77)&lt;/li&gt;&lt;li&gt;HELM Safety: 85.6767 (#49/59)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 15.57 (#51/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Palmyra X5&lt;/strong&gt; — ELO 1618&lt;ul&gt;&lt;li&gt;OpenEval - GPQA CoT: 66.14 (#9/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 80.4 (#11/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 41.45 (#16/74)&lt;/li&gt;&lt;li&gt;OpenEval - IFEval Strict: 82.29 (#30/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Palmyra-X-004&lt;/strong&gt; — ELO 1577&lt;ul&gt;&lt;li&gt;OpenEval - IFEval Strict: 87.25 (#9/77)&lt;/li&gt;&lt;li&gt;OpenEval - Omni-MATH: 31.97 (#28/74)&lt;/li&gt;&lt;li&gt;OpenEval - MMLU-Pro CoT: 65.7 (#31/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Pixtral-12B-2409&lt;/strong&gt; — ELO 1408&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1490.38 (#67/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Max (2026-01-23)&lt;/strong&gt; — ELO 1663&lt;ul&gt;&lt;li&gt;ClawProBench: 55.76 (#33/57)&lt;/li&gt;&lt;li&gt;IOI: 13.75 (#34/64)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 54.98 (#36/54)&lt;/li&gt;&lt;li&gt;MedScribe: 72.71 (#57/74)&lt;/li&gt;&lt;li&gt;MedCode: 31.37 (#66/75)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5&lt;/strong&gt; — ELO 1706&lt;ul&gt;&lt;li&gt;APEX-Agents: 27.7 (#29/45)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 Max&lt;/strong&gt; — ELO 1714&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 114.0 (#36/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Flash&lt;/strong&gt; — ELO 1633&lt;ul&gt;&lt;li&gt;AI for Education Pedagogy - Science: 91.26 (#33/233)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Secondary: 84.75 (#65/233)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Primary: 88.73 (#68/233)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Maths: 84.92 (#69/233)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Social studies: 83.64 (#69/233)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy: 84.76 (#71/233)&lt;/li&gt;&lt;li&gt;AI for Education SEND: 77.52 (#88/225)&lt;/li&gt;&lt;li&gt;AI for Education Pedagogy - Technology: 81.13 (#89/233)&lt;/li&gt;&lt;li&gt;SvelteBench: 82.5 (#113/169)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 27B&lt;/strong&gt; — ELO 1717&lt;ul&gt;&lt;li&gt;LLM Stats (BabyVision): 85.6 (#2/10)&lt;/li&gt;&lt;li&gt;LLM Stats (MathVision): 94.6 (#2/33)&lt;/li&gt;&lt;li&gt;LLM Stats (OSWorld-Verified): 84.3 (#3/24)&lt;/li&gt;&lt;li&gt;LLM Stats (CharXiv-R): 90.2 (#4/51)&lt;/li&gt;&lt;li&gt;LLM Stats (OmniDocBench 1.5): 91.1 (#4/18)&lt;/li&gt;&lt;li&gt;LLM Stats (Agents' Last Exam): 42.9 (#5/10)&lt;/li&gt;&lt;li&gt;LLM Stats (RealWorldQA): 85.9 (#5/29)&lt;/li&gt;&lt;li&gt;LLM Stats (ERQA): 65.5 (#7/24)&lt;/li&gt;&lt;li&gt;LLM Stats (NL2Repo): 42.3 (#11/17)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 73.0 (#16/28)&lt;/li&gt;&lt;li&gt;...and 5 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen3.8 2.4T A95B&lt;/strong&gt; — ELO 1726&lt;ul&gt;&lt;li&gt;Tau3 Banking: 49.07 (#3/166)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 93.54 (#8/575)&lt;/li&gt;&lt;li&gt;AA GDPval: 1720.39 (#8/198)&lt;/li&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 57.7 (#11/574)&lt;/li&gt;&lt;li&gt;AA CritPt: 20.0 (#22/479)&lt;/li&gt;&lt;li&gt;AA Humanity's Last Exam: 42.45 (#25/567)&lt;/li&gt;&lt;li&gt;SvelteBench: 96.7 (#27/169)&lt;/li&gt;&lt;li&gt;AA Omniscience - Software Engineering (SWE) - Rust: 82.0 (#30/479)&lt;/li&gt;&lt;li&gt;AA SciCode: 51.62 (#39/567)&lt;/li&gt;&lt;li&gt;AA Long Context Reasoning: 75.33 (#44/500)&lt;/li&gt;&lt;li&gt;...and 22 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Step 3.5 Flash 2603&lt;/strong&gt; — ELO 1602&lt;ul&gt;&lt;li&gt;ClawProBench: 42.59 (#52/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Yi Large&lt;/strong&gt; — ELO 1519&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1473.21 (#74/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Yi-1.5-9B-Chat-16K&lt;/strong&gt; — ELO 1455&lt;ul&gt;&lt;li&gt;Fin-Bias: 83.4 (#18/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Yi-Coder-9B-Chat&lt;/strong&gt; — ELO 1391&lt;ul&gt;&lt;li&gt;FullStackBench en: 47.13 (#20/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (180)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on APEX-Agents-AA: 59.2 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on ArxivMath: 87.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Computer Anthology Terminal Tasks (Claude Code): 54.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Computer Anthology Terminal Tasks (Terminus-2): 50.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Finance Agent v2: 56.31 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on FrontierCode: 63.6 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on IOI: 72.25 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LiveBench: 78.57 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on MedCode: 56.07 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on MedScribe: 88.52 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on ProofBench: 77.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Roboflow Playground Classification: 1200.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Vals Index: 75.14 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Vals Multimodal Index: 74.15 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Mythos 5&lt;/strong&gt; on OSWorld-Verified: 85.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AIIQ Composite IQ: 134.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Agent Security League - Functional Correctness: 73.7 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Arena AI Code: 1692.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Arena AI Document: 1520.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Benchmarks.bio - BioSecBench-Refusal: 36.3 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Computer Anthology Terminal Tasks (Claude Code): 54.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Computer Anthology Terminal Tasks (Terminus-2): 62.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Creative Writing (Lechmazur): 4.2 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Design Arena (SVG): 1361.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Finance Agent v2: 58.63 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on IOI: 91.67 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM Chess (Saplin): 1285.4 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LMArena Text Arena: 1493.6 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LMArena WebDev Arena: 1691.77 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenRouter BrowseComp (Search): 89.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenRouter DeepSearchQA (Search): 76.5 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OpenRouter HLE (Search): 77.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on ProgramBench: 4.5 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on ProgramBench Almost: 37.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on TrackingAI IQ Test (Vision): 88.24 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI (Vals Index): 67.21 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Code Migration: 57.47 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Excel Modeling: 73.56 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI LiveCodeBench: 89.03 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI MMLU-Pro: 91.59 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals Index: 74.82 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals Multimodal Index: 73.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on DeepsecBench: 22.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on FrontierSWE: 78.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (Agents' Last Exam): 28.5 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (DeepSWE 1.1): 66.9 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (FrontierSWE): 78.1 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (NL2Repo): 58.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (Program Bench): 19.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (Terminal-Bench 2.1): 88.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (Toolathlon): 73.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats Score: 54.66 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on Vending-Bench 2: 8163.61 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on VoxelBench: 1806.0 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on MathArena Apex: 69.79 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on PM-LLM-Benchmark: 37.7 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AIIQ Composite IQ: 136.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on APEX-Agents: 39.9 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on APEX-Agents-AA: 56.7 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Android Bench: 90.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Arena AI Code: 1623.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Arena AI Document: 1479.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on BabyVision: 88.9 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CADGenBench: 0.5319 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CharXiv-R: 84.6 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Computer Anthology Terminal Tasks (Codex CLI): 58.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Computer Anthology Terminal Tasks (Terminus-2): 51.6 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Design Arena (Website): 1337.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Finance Agent v2: 53.76 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on FrontierCode: 60.6 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on GDP.pdf: 30.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on IOI: 86.67 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LLM Chess (Saplin): 1549.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LMArena Text Arena: 1480.8 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LMArena WebDev Arena: 1622.87 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on MCP Atlas: 83.6 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on MedCode: 43.97 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on MedScribe: 85.23 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OmniDocBench 1.5: 85.8 (#41)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenRouter BrowseComp (Search): 82.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenRouter DeepSearchQA (Search): 75.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OpenRouter HLE (Search): 71.1 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on PLawBench: 72.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ProgramBench: 1.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ProgramBench Almost: 15.5 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ProofBench: 77.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ProphetArena: 0.9506 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Toolathlon: 74.9 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals Index: 73.12 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Vals Multimodal Index: 72.19 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA CritPt: 14.29 (#37)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA GDPval: 1525.3 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA GPQA Diamond: 94.55 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Humanity's Last Exam: 47.87 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Long Context Reasoning: 81.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA MMMU-Pro: 85.49 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience: 26.48 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Business: 45.6 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Health: 44.7 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 55.2 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Law: 62.1 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 52.0 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 72.3 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - C: 90.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Dart: 68.0 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Go: 74.0 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - HTML: 80.0 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Java: 57.0 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - JavaScript: 77.27 (#28)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Julia: 64.0 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Kotlin: 62.0 (#45)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - PHP: 78.0 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Python: 71.5 (#37)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - R: 60.0 (#35)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Rust: 82.0 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Swift: 80.0 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - TypeScript: 76.67 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA SciCode: 57.87 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA-Briefcase: 36.36 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA-Omniscience Accuracy: 55.32 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI Chess Leaderboard (Continuation): 1753.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI Chess Leaderboard (Reasoning): 1854.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena: 3.61 (#31)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena - Bash Recovery: 2.33 (#42)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena - Confirmed Success: 9.85 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena - Praise vs Complaint: 1.84 (#44)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena - Steerability: 2.83 (#38)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena - Tool Hallucination: 1.18 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Arabic Broad Leaderboard: 9.204 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Artificial Analysis Intelligence Index: 56.03 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AutomationBench: 30.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on BenchLM: 61.4 (#50)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Chatbot Arena (Code): 1587.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Chatbot Arena (Text): 1490.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Chess Puzzles (Epoch AI): 47.0 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ClockBench: 48.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Coarena: 1039.4 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Coarena - Task Completion: 78.1 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Computer Anthology Terminal Tasks (Terminus-2): 46.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Creative Writing (Lechmazur): -0.4 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on CursorBench 3.1: 61.6 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Design Arena (Game Dev): 1310.0 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Design Arena (Website): 1348.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Epoch AI - Mystery Game Puzzles: 37.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on FrontierMath - Tier 4 (v2): 36.59 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on FrontierMath - Tiers 1-3 (v2): 71.58 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Kaggle FACTS Grounding: 75.63 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (Agents' Last Exam): 26.3 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (Artificial Analysis): 56.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (AutomationBench): 30.4 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (CharXiv-R): 88.7 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (DeepSWE 1.1): 65.3 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (FrontierCode 1.1): 43.6 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (GDP.pdf): 34.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (Terminal-Bench 2.1): 85.8 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats Score: 51.2 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LM Market Cap LMC Score: 40.0 (#239)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on MineBench: 1788.74 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Multi-turn Debate (Lechmazur): 1476.3 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OTIS Mock AIME 2024-25: 97.22 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenRouter GPQA Diamond: 92.3 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenRouter Tau2-Bench Airline: 80.6 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ProfBench: 57.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ProgramBench: 0.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ProgramBench Almost: 5.5 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on RuneBench: 10203.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on SealedBench: 56.0 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on SimpleQA Verified: 71.2 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on SpeechMap Compliance: 85.8 (#60)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on SvelteBench: 100.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Tau3 Banking: 35.46 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI (Vals Index): 59.31 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Excel Modeling: 71.33 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Finance Agent v2: 59.04 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Harvey Legal Agent Bench: 8.75 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Legal Research Bench: 34.62 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI ProofBench: 58.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 77.53 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Vibe Code Bench: 70.39 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on VoxelBench: 1893.0 (#9)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (61)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Sycophancy (Lechmazur)&lt;/strong&gt;: GPT-5.6 Terra (Thinking, High) (0.0) beat Claude Fable 5 (Thinking, Medium) by 980990.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;RuneBench&lt;/strong&gt;: Grok 4.6 (12757.0) beat Grok 4.5 by 4041.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;The Compliance Gap&lt;/strong&gt;: Mistral Small 24B (100.0) beat Llama 3.3 70B by 90.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Slides)&lt;/strong&gt;: playyy (1303.0) beat Claude 3 Opus by 66.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenEval - Omni-MATH&lt;/strong&gt;: Qwen 3 235B A22B 2507 Instruct (71.83) beat Gemma 3 27B (IT) by 31.82&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenEval - GPQA CoT&lt;/strong&gt;: Gemini 3 Pro (Preview) (80.27) beat qwen-3-80B-instruct by 23.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProgramBench Almost&lt;/strong&gt;: Claude Opus 5 (xHigh) (37.0) beat Claude Opus 4.8 (xHigh) by 20.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (APEX-Agents)&lt;/strong&gt;: Grok 4.6 (57.5) beat Kimi K3 by 19.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Coarena - Task Completion&lt;/strong&gt;: Qwen 3.8 Max (100.0) beat GPT-5.6 Terra by 18.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CHI-Bench&lt;/strong&gt;: Claude Opus 5 (54.7) beat Claude Opus 4.8 by 17.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (AutomationBench)&lt;/strong&gt;: GLM-5.3 (48.2) beat Kimi K3 by 17.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Arena&lt;/strong&gt;: Claude Opus 4.7 (1021.5) beat Claude Fable 5 by 16.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ASCIIBench&lt;/strong&gt;: Claude Opus 4.5 (1685.0) beat Gemini 3 Pro (Preview) by 16.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenRouter BrowseComp (Search)&lt;/strong&gt;: Claude Opus 5 (High) (89.0) beat GPT-5.6 Sol by 14.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Video Edit)&lt;/strong&gt;: minimax-h3 (1390.0) beat dreamina-seedance-2.0-720p by 13.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenEval - MMLU-Pro CoT&lt;/strong&gt;: Gemini 3 Pro (Preview) (90.3) beat qwen-3-80B-instruct by 12.47&lt;/li&gt;&lt;li&gt;&lt;strong&gt;APEX-Agents-AA&lt;/strong&gt;: Claude Fable 5 (Max) (59.2) beat Gemini 3.5 Flash (High) by 12.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Image-to-Video)&lt;/strong&gt;: minimax-h3 (1489.0) beat dreamina-seedance-2.0-720p by 11.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FrontierCode&lt;/strong&gt;: Claude Fable 5 (Max) (63.6) beat Claude Opus 5 by 10.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Arena AI Document&lt;/strong&gt;: Claude Opus 5 (High) (1520.0) beat Claude Opus 4.6 by 10.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Arena AI Code&lt;/strong&gt;: Claude Opus 5 (Max) (1692.0) beat Kimi K3 by 10.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MathArena Apex&lt;/strong&gt;: DeepSeek V4 Pro (Max) (90.2) beat GPT-5.5 (xHigh) by 9.99&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LMArena WebDev Arena&lt;/strong&gt;: Claude Opus 5 (Max) (1691.77) beat Kimi K3 by 9.76&lt;/li&gt;&lt;li&gt;&lt;strong&gt;NatureBench&lt;/strong&gt;: Claude Opus 5 (23.33) beat Claude Opus 4.7 by 7.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BabyVision&lt;/strong&gt;: Qwen3.8-Max (with tools) (91.3) beat GPT-5.5 by 7.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Android Bench&lt;/strong&gt;: Claude Opus 5 (91.8) beat Claude Fable 5 by 7.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Game Dev)&lt;/strong&gt;: Kimi K3 (1432.0) beat Claude Opus 5 by 6.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (NL2Repo)&lt;/strong&gt;: DeepSeek V4 Pro (0813) (61.5) beat Qwen 3.8 Max by 5.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (MRCR v2 (8-needle))&lt;/strong&gt;: Gemini 3.7 Flash (97.0) beat GPT-5.6 Sol by 5.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenRouter HLE (Search)&lt;/strong&gt;: Claude Opus 5 (High) (77.4) beat Claude Opus 5 by 4.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MedCode&lt;/strong&gt;: Claude Opus 5 (63.57) beat Gemini 3.1 Pro (Preview) (High) by 4.51&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA-LCR&lt;/strong&gt;: Muse Glimmer 30B (80.0) beat GPT-5.2 Codex (xHigh) by 4.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AutomationBench&lt;/strong&gt;: Gemini 3.7 Flash (High) (30.4) beat Claude Opus 5 (Max) by 4.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PhysicsFinals&lt;/strong&gt;: Gemini 1.5 Pro (63.9) beat O3 Mini by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (LVBench)&lt;/strong&gt;: Gemini 3.7 Flash (85.4) beat Qwen 3.8 Max by 3.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Security League - Security Correctness&lt;/strong&gt;: Claude Opus 5 (32.4) beat Claude Fable 5 by 3.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenEval - IFEval Strict&lt;/strong&gt;: Claude 3.7 Sonnet (20250219) (Thinking 10K) (94.0) beat qwen-3-80B-instruct by 2.75&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GameCraft-Bench&lt;/strong&gt;: Claude Opus 5 (68.44) beat Claude Fable 5 by 2.72&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL Showdown&lt;/strong&gt;: GPT-4o Audio (Preview 2025-06-03) (1269.2) beat Gemini 3 Pro (Preview) by 2.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (PostTrainBench)&lt;/strong&gt;: GLM-5.3 (39.8) beat MiniMax-M3 by 2.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Praise vs Complaint&lt;/strong&gt;: Claude Fable 5 (High) (25.14) beat GPT-5.6 Sol (xHigh) by 2.44&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MedScribe&lt;/strong&gt;: Claude Opus 5 (90.98) beat Muse Spark 1.1 (xHigh) by 2.09&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (CyberGym)&lt;/strong&gt;: GLM-5.3 (84.5) beat Gemini 3.5 Flash Cyber by 1.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Chess (Saplin)&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (1549.7) beat GPT-5.6 Sol (High) by 1.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (WideSearch)&lt;/strong&gt;: Qwen 3.8 Max (81.9) beat Kimi K2.6 by 1.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Computer Anthology Terminal Tasks (Gemini CLI)&lt;/strong&gt;: Gemini 3.5 Flash (High) (24.4) beat Gemini 3.5 Flash by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WritingBench&lt;/strong&gt;: Qwen 3 235B A22B 2507 (Thinking) (88.3) beat Qwen 3 Next 80B A3B Instruct by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ComplexFuncBench&lt;/strong&gt;: GPT-4o (66.5) beat GPT-4.1 by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProofBench&lt;/strong&gt;: Claude Opus 5 (78.0) beat Claude Fable 5 (Max) by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Creative Writing (Lechmazur)&lt;/strong&gt;: Claude Opus 5 (xHigh) (4.2) beat Claude Fable 5 (High) by 0.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA GPQA Diamond&lt;/strong&gt;: Grok 4.6 (High) (94.95) beat GPT-5.6 Sol (Max) by 0.81&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA MMMU-Pro&lt;/strong&gt;: Gemini 3.7 Flash (High) (85.49) beat Claude Opus 5 (Adaptive Reasoning, Max Effort) by 0.75&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Finance Agent v2&lt;/strong&gt;: Claude Opus 5 (Max) (58.63) beat Gemini 3.5 Flash by 0.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SpatialGen-Bench (Text Answering)&lt;/strong&gt;: Qwen 3.8 Max (81.74) beat Claude Fable 5 by 0.48&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CursorBench 3.1&lt;/strong&gt;: Grok 4.6 (xHigh) (70.8) beat Claude Fable 5 (Max) by 0.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GDPevo&lt;/strong&gt;: Claude Opus 4.8 (50.63) beat Claude Opus 4.6 by 0.23&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenEval - CNN/DailyMail&lt;/strong&gt;: command-xlarge-beta (25.84) beat Llama 2 70B by 0.22&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ForecastBench&lt;/strong&gt;: rice-demon (69.1) beat captain-jack by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Computer Anthology Terminal Tasks (Terminus-2)&lt;/strong&gt;: Claude Opus 5 (High) (62.0) beat Claude Opus 5 by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CADGenBench&lt;/strong&gt;: build123d-mcp-v0381-claude-opus-5-xhigh-full-r6 (0.6391) beat GPT-5.6 Sol (xHigh) by 0.11&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CPTU Bench&lt;/strong&gt;: Muse-Glimmer-30B (Reasoning) (4.42) beat Qwen 3.5 27B (Thinking) by 0.08&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-16

=== DAILY ===
NEW SCORES FROM TOP-10 MODELS (17)
  - Claude Opus 5 on Agent Security League - Functional Correctness: 73.7 Functional Correctness (%) (#9/19)
  - GLM-5.3 on DeepsecBench: 22.0 Recall-weighted F2 score (%) (#6/35)
  - GPT-5.6 Sol on BabyVision: 88.9 </summary></entry><entry><title>The Aggregate Digest — 2026-08-15</title><id>https://theaggregate.ai/digest/2026-08-15</id><updated>2026-08-15T05:12:04.017807+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Frontier&lt;/h2&gt;
&lt;ul&gt;&lt;li&gt;Best available model: Gemini 3.7 Flash (1782) takes the crown from GPT-5.5 Pro (1776)&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (10)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Agents on Rails&lt;/strong&gt; (Successful Runs (%)): leader Claude Opus 5 (92.1), 8 models&lt;br&gt;&lt;span&gt;The Rails Foundation&amp;#x27;s agentic coding benchmark: 21 atomic Rails tasks against the Writebook app — bug reports, security findings and feature requests written the way they would actually be filed — run three times per model through one frozen minimal harness at each provider&amp;#x27;s default reasoning effort, and graded by hidden behavioural test suites; the score is the share of runs whose tests pass.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenAI GPT-5.6 System Card - HealthBench Professional&lt;/strong&gt; (Length-Adjusted Score (0-100)): leader GPT-5.6 Sol (60.5), 8 models&lt;br&gt;&lt;span&gt;HealthBench professional subset for medically challenging, expert-oriented healthcare questions, on the length-adjusted scale; OpenAI&amp;#x27;s own runs as published in the GPT-5.6 system card.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenAI GPT-5.6 System Card - HealthBench&lt;/strong&gt; (Length-Adjusted Score (0-100)): leader GPT-5 (57.7), 8 models&lt;br&gt;&lt;span&gt;HealthBench health conversations graded against physician-written rubrics, on the length-adjusted scale the card headlines; OpenAI&amp;#x27;s own runs as published in the GPT-5.6 system card.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenAI GPT-5.6 System Card - HealthBench Hard&lt;/strong&gt; (Length-Adjusted Score (0-100)): leader GPT-5 (34.7), 8 models&lt;br&gt;&lt;span&gt;Hard subset of HealthBench, the conversations frontier models still fail, on the length-adjusted scale; OpenAI&amp;#x27;s own runs as published in the GPT-5.6 system card.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenAI GPT-5.6 System Card - HealthBench Consensus&lt;/strong&gt; (Length-Adjusted Score (0-100)): leader GPT-5.4 (96.3), 8 models&lt;br&gt;&lt;span&gt;HealthBench Consensus subset — the rubric criteria physicians agreed on — on the length-adjusted scale; OpenAI&amp;#x27;s own runs as published in the GPT-5.6 system card.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenAI GPT-5.6 System Card - AAV Capsid Packaging Prediction&lt;/strong&gt; (Spearman Correlation): leader GPT-5.6 Sol (0.529), 2 models&lt;br&gt;&lt;span&gt;Biosecurity capability slice from OpenAI&amp;#x27;s GPT-5.6 system card — predicting AAV capsid packaging fitness, scored as Spearman correlation against measured values; OpenAI-run frontier comparison.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenAI GPT-5.6 System Card - Hard Negative Protein Binding Prediction&lt;/strong&gt; (pass@4 (%)): leader GPT-5.6 Sol (7.6), 4 models&lt;br&gt;&lt;span&gt;Biosecurity capability slice from OpenAI&amp;#x27;s GPT-5.6 system card — hard-negative protein-binding prediction; OpenAI-run frontier comparison.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenAI GPT-5.6 System Card - DNA Sequence Design for TF Binding&lt;/strong&gt; (pass@1 (%)): leader GPT-5.5 Pro (16.5), 4 models&lt;br&gt;&lt;span&gt;Biosecurity capability slice from OpenAI&amp;#x27;s GPT-5.6 system card — designing DNA sequences for transcription-factor binding; OpenAI-run frontier comparison.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (AndroidWorld)&lt;/strong&gt; (Score (%)): leader Qwen 3.8 Max (85.3), 5 models&lt;br&gt;&lt;span&gt;AndroidWorld as aggregated by LLM Stats — autonomous-agent tasks on a real Android emulator covering app interaction, navigation, and multi-step task completion.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (ExploitBench)&lt;/strong&gt; (Score (%)): leader Claude Fable 5 (78.0), 5 models&lt;br&gt;&lt;span&gt;ExploitBench as aggregated by LLM Stats — offensive-security agent tasks built from patched browser-engine vulnerabilities, graded on how far a model gets toward a working exploit.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; — ELO 1772&lt;ul&gt;&lt;li&gt;LLM Stats (AutomationBench): 48.2 (#1/12)&lt;/li&gt;&lt;li&gt;LLM Stats (CyberGym): 84.5 (#1/13)&lt;/li&gt;&lt;li&gt;LLM Stats (PostTrainBench): 39.8 (#1/6)&lt;/li&gt;&lt;li&gt;FrontierSWE: 78.0 (#2/17)&lt;/li&gt;&lt;li&gt;LLM Stats (NL2Repo): 58.0 (#2/17)&lt;/li&gt;&lt;li&gt;LLM Stats (FrontierSWE): 78.1 (#3/16)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 88.2 (#3/28)&lt;/li&gt;&lt;li&gt;LLM Stats (Toolathlon): 73.0 (#4/37)&lt;/li&gt;&lt;li&gt;Vending-Bench 2: 8163.61 (#6/60)&lt;/li&gt;&lt;li&gt;LLM Stats (Program Bench): 19.0 (#6/6)&lt;/li&gt;&lt;li&gt;...and 3 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 27B&lt;/strong&gt; — ELO 1717&lt;ul&gt;&lt;li&gt;LLM Stats (BabyVision): 85.6 (#2/10)&lt;/li&gt;&lt;li&gt;LLM Stats (MathVision): 94.6 (#2/33)&lt;/li&gt;&lt;li&gt;LLM Stats (OSWorld-Verified): 84.3 (#3/24)&lt;/li&gt;&lt;li&gt;LLM Stats (CharXiv-R): 90.2 (#4/51)&lt;/li&gt;&lt;li&gt;LLM Stats (OmniDocBench 1.5): 91.1 (#4/18)&lt;/li&gt;&lt;li&gt;LLM Stats (Agents' Last Exam): 42.9 (#5/10)&lt;/li&gt;&lt;li&gt;LLM Stats (RealWorldQA): 85.9 (#5/29)&lt;/li&gt;&lt;li&gt;LLM Stats (ERQA): 65.5 (#7/24)&lt;/li&gt;&lt;li&gt;LLM Stats (NL2Repo): 42.3 (#11/17)&lt;/li&gt;&lt;li&gt;Humanity's Last Exam (Self-Reported, No Tools): 30.8 (#14/50)&lt;/li&gt;&lt;li&gt;...and 4 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (32)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Benchmarks.bio - BioSecBench-Refusal: 36.3 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Creative Writing (Lechmazur): 4.2 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on FrontierSWE: 78.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (Agents' Last Exam): 28.5 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (DeepSWE 1.1): 66.9 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (FrontierSWE): 78.1 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (NL2Repo): 58.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (Program Bench): 19.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (Terminal-Bench 2.1): 88.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on LLM Stats (Toolathlon): 73.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on Vending-Bench 2: 8163.61 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.3&lt;/strong&gt; on VoxelBench: 1773.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on BenchLM: 61.4 (#50)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Computer Anthology Terminal Tasks (Terminus-2): 46.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Creative Writing (Lechmazur): -0.4 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Kaggle FACTS Grounding: 75.63 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenRouter GPQA Diamond: 92.3 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on OpenRouter Tau2-Bench Airline: 80.6 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ProfBench: 57.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on SealedBench: 56.0 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on SvelteBench: 100.0 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI (Vals Index): 59.31 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Excel Modeling: 71.33 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Finance Agent v2: 59.04 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Harvey Legal Agent Bench: 8.75 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Legal Research Bench: 34.62 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI ProofBench: 58.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Terminal-Bench 2.1: 77.53 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Vals AI Vibe Code Bench: 70.39 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on CHI-Bench: 25.3 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Design Arena (SVG): 1340.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on ProfBench: 57.9 (#7)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Game Dev)&lt;/strong&gt;: Kimi K3 (1436.0) beat Claude Opus 5 by 33.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CHI-Bench&lt;/strong&gt;: Claude Opus 5 (54.7) beat Claude Opus 4.8 by 17.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (AutomationBench)&lt;/strong&gt;: GLM-5.3 (48.2) beat DeepSeek V4 Pro (0813) by 16.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (PostTrainBench)&lt;/strong&gt;: GLM-5.3 (39.8) beat MiniMax-M3 by 2.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (CyberGym)&lt;/strong&gt;: GLM-5.3 (84.5) beat DeepSeek V4 Pro (0813) by 1.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Creative Writing (Lechmazur)&lt;/strong&gt;: Claude Opus 5 (xHigh) (4.2) beat Claude Fable 5 (High) by 0.9&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-15

=== FRONTIER ===
  - Best available model: Gemini 3.7 Flash (1782) takes the crown from GPT-5.5 Pro (1776)

=== DAILY ===
NEW BENCHMARKS (10)
  - Agents on Rails (Successful Runs (%)): leader Claude Opus 5 (92.1), 8 models
      The Rails Foundation's agentic codin</summary></entry><entry><title>The Aggregate Digest — 2026-08-14</title><id>https://theaggregate.ai/digest/2026-08-14</id><updated>2026-08-14T06:22:09.151361+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (OSWorld 2.0)&lt;/strong&gt; (Score (%)): leader Claude Opus 5 (70.6), 5 models&lt;br&gt;&lt;span&gt;llm-stats.com’s mirror of OSWorld 2.0, the computer-use agent benchmark on real desktop applications. Its roster is currently disjoint from the first-party OSWorld 2.0 board — newer models only — and its scale matches the partial-credit column rather than the binary one.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; — ELO 1780, #3&lt;ul&gt;&lt;li&gt;AA MMMU-Pro: 85.49 (#1/240)&lt;/li&gt;&lt;li&gt;AutomationBench: 30.4 (#1/10)&lt;/li&gt;&lt;li&gt;LLM Stats (LVBench): 85.4 (#1/25)&lt;/li&gt;&lt;li&gt;LLM Stats (MRCR v2 (8-needle)): 97.0 (#1/23)&lt;/li&gt;&lt;li&gt;Coarena - Task Completion: 80.0 (#2/12)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 94.55 (#2/575)&lt;/li&gt;&lt;li&gt;LLM Stats (Artificial Analysis): 56.0 (#2/7)&lt;/li&gt;&lt;li&gt;LLM Stats (GDP.pdf): 34.0 (#2/6)&lt;/li&gt;&lt;li&gt;RuneBench: 10203.0 (#2/46)&lt;/li&gt;&lt;li&gt;AI Chess Leaderboard (Reasoning): 1855.0 (#2/313)&lt;/li&gt;&lt;li&gt;...and 55 more&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (73)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on LLM Chess (Saplin): 1285.4 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on ProgramBench: 4.5 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on ProgramBench Almost: 37.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI (Vals Index): 67.21 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals AI Excel Modeling: 73.56 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Android Bench: 90.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ProgramBench: 0.5 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on ProgramBench Almost: 2.5 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA CritPt: 14.29 (#37)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA GDPval: 1525.3 (#24)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA GPQA Diamond: 94.55 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Humanity's Last Exam: 47.87 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Long Context Reasoning: 81.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA MMMU-Pro: 85.49 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience: 26.48 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Business: 45.6 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Health: 44.7 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 55.2 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Law: 62.1 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 52.0 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 72.3 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - C: 90.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Dart: 68.0 (#21)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Go: 74.0 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - HTML: 80.0 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Java: 57.0 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - JavaScript: 77.27 (#28)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Julia: 64.0 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Kotlin: 62.0 (#45)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - PHP: 78.0 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Python: 71.5 (#36)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - R: 60.0 (#35)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Rust: 82.0 (#25)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Swift: 80.0 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - TypeScript: 76.67 (#27)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA SciCode: 57.87 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA-Briefcase: 36.36 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AA-Omniscience Accuracy: 55.32 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI Chess Leaderboard (Continuation): 1757.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AI Chess Leaderboard (Reasoning): 1855.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena: 3.61 (#31)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena - Bash Recovery: 2.33 (#42)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena - Confirmed Success: 9.85 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena - Praise vs Complaint: 1.84 (#44)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena - Steerability: 2.83 (#38)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Agent Arena - Tool Hallucination: 1.18 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Artificial Analysis Intelligence Index: 56.03 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on AutomationBench: 30.4 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Chatbot Arena (Code): 1588.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Chatbot Arena (Text): 1490.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on ClockBench: 48.3 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Coarena: 1002.3 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Coarena - Task Completion: 80.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Conceptual Reasoning Index: 64.56 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Conceptual Reasoning Index - Argument Evaluation (LMCA): 50.38 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Conceptual Reasoning Index - Consistency (ACCoRD): 76.98 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Conceptual Reasoning Index - Decision Theory (DTBench): 94.67 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (Agents' Last Exam): 26.3 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (Artificial Analysis): 56.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (AutomationBench): 30.4 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (CharXiv-R): 88.7 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (DeepSWE 1.1): 65.3 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (FrontierCode 1.1): 43.6 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (GDP.pdf): 34.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LLM Stats (Terminal-Bench 2.1): 85.8 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on LM Market Cap LMC Score: 40.0 (#238)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on MineBench: 1786.21 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on RuneBench: 10203.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on SpeechMap Compliance: 85.8 (#60)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on Tau3 Banking: 35.46 (#23)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.7 Flash&lt;/strong&gt; on VoxelBench: 1892.0 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Android Bench: 90.2 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals AI Excel Modeling: 66.4 (#7)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (17)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;OpenEval - Omni-MATH&lt;/strong&gt;: Qwen 3 235B A22B 2507 Instruct (71.83) beat Gemma 3 27B (IT) by 31.82&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenEval - GPQA CoT&lt;/strong&gt;: Gemini 3 Pro (Preview) (80.27) beat qwen-3-80B-instruct by 23.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProgramBench Almost&lt;/strong&gt;: Claude Opus 5 (xHigh) (37.0) beat Claude Opus 4.8 (xHigh) by 20.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Chatbot Arena (Video Edit)&lt;/strong&gt;: minimax-h3 (1390.0) beat dreamina-seedance-2.0-720p by 13.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenEval - MMLU-Pro CoT&lt;/strong&gt;: Gemini 3 Pro (Preview) (90.3) beat qwen-3-80B-instruct by 12.47&lt;/li&gt;&lt;li&gt;&lt;strong&gt;NatureBench&lt;/strong&gt;: Claude Opus 5 (23.33) beat Claude Opus 4.7 by 7.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Android Bench&lt;/strong&gt;: Claude Opus 5 (91.8) beat Claude Fable 5 by 7.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (NL2Repo)&lt;/strong&gt;: DeepSeek V4 Pro (0813) (61.5) beat Qwen 3.8 Max by 5.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (MRCR v2 (8-needle))&lt;/strong&gt;: Gemini 3.7 Flash (97.0) beat GPT-5.6 Sol by 5.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (LVBench)&lt;/strong&gt;: Gemini 3.7 Flash (85.4) beat Qwen 3.8 Max by 3.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AutomationBench&lt;/strong&gt;: Gemini 3.7 Flash (High) (30.4) beat Claude Opus 5 (Max) by 3.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenEval - IFEval Strict&lt;/strong&gt;: Claude 3.7 Sonnet (20250219) (Thinking 10K) (94.0) beat qwen-3-80B-instruct by 2.75&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (WideSearch)&lt;/strong&gt;: Qwen 3.8 Max (81.9) beat Kimi K2.6 by 1.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (AutomationBench)&lt;/strong&gt;: DeepSeek V4 Pro (0813) (31.8) beat Kimi K3 by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA MMMU-Pro&lt;/strong&gt;: Gemini 3.7 Flash (High) (85.49) beat Claude Opus 5 (Adaptive Reasoning, Max Effort) by 0.75&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenEval - CNN/DailyMail&lt;/strong&gt;: command-xlarge-beta (25.84) beat Llama 2 70B by 0.22&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (CyberGym)&lt;/strong&gt;: DeepSeek V4 Pro (0813) (83.3) beat Gemini 3.5 Flash Cyber by 0.1&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-14

=== DAILY ===
NEW BENCHMARKS (1)
  - LLM Stats (OSWorld 2.0) (Score (%)): leader Claude Opus 5 (70.6), 5 models
      llm-stats.com’s mirror of OSWorld 2.0, the computer-use agent benchmark on real desktop applications. Its roster is currently disjoint from the fir</summary></entry><entry><title>The Aggregate Digest — 2026-08-13</title><id>https://theaggregate.ai/digest/2026-08-13</id><updated>2026-08-13T06:35:25.130271+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Conceptual Reasoning Index&lt;/strong&gt; (Chance-Corrected Score (0-100)): leader Claude Opus 5 (73.57), 134 models&lt;br&gt;&lt;span&gt;Redwood Research index for topics that cannot be graded against an answer key — AI alignment, collective action under transformative AI: a 60/20/20 blend of argument evaluation, belief consistency and decision theory, scaled so 0 is random guessing and 100 the maximum attainable.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Conceptual Reasoning Index - Argument Evaluation (LMCA)&lt;/strong&gt; (Chance-Corrected Score (0-100)): leader Claude Opus 5 (63.3), 135 models&lt;br&gt;&lt;span&gt;The 60% component of the CRI — models rate the strength of conceptual critiques of stated positions over 1,461 rated critiques, scored as the Pearson correlation with expert consensus ratings times 100; the estimated human ceiling is about 85, not 100.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Conceptual Reasoning Index - Consistency (ACCoRD)&lt;/strong&gt; (Chance-Corrected Score (0-100)): leader Claude Fable 5 (84.95), 134 models&lt;br&gt;&lt;span&gt;The consistency component of the CRI — models give probabilities for related claims, and 567 logical constraints such as P(A) = P(A|B)P(B) + P(A|¬B)P(¬B) measure how far the stated beliefs drift under reframing; 0-100, higher is more coherent.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Conceptual Reasoning Index - Decision Theory (DTBench)&lt;/strong&gt; (Chance-Corrected Score (0-100)): leader Claude Fable 5 (97.33), 191 models&lt;br&gt;&lt;span&gt;The decision-theory component of the CRI — 407 expert-verified Newcomb-like problems where the model reasons about interacting with near-copies of itself; accuracy chance-corrected against the 40% random baseline onto a 0-100 scale.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Grok 4.6&lt;/strong&gt; — ELO 1745, #12&lt;ul&gt;&lt;li&gt;RuneBench: 12757.0 (#1/44)&lt;/li&gt;&lt;li&gt;LLM Stats (APEX-Agents): 57.5 (#1/8)&lt;/li&gt;&lt;li&gt;Mercor APEX: 41.2 (#6/53)&lt;/li&gt;&lt;li&gt;Vals AI Code Migration: 44.57 (#6/42)&lt;/li&gt;&lt;li&gt;DeepSWE: 67.5 (#7/27)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSWE 1.1): 65.9 (#8/21)&lt;/li&gt;&lt;li&gt;LLM Stats Score: 45.3 (#21/333)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 88.8 (#44/416)&lt;/li&gt;&lt;li&gt;BenchLM: 62.5 (#45/200)&lt;/li&gt;&lt;li&gt;SpeechMap Compliance: 83.6 (#74/366)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro (0813)&lt;/strong&gt; — ELO 1724, #20&lt;ul&gt;&lt;li&gt;NL2Repo: 61.5 (#2/21)&lt;/li&gt;&lt;li&gt;CyberGym: 83.3 (#2/16)&lt;/li&gt;&lt;li&gt;Toolathlon: 74.1 (#8/34)&lt;/li&gt;&lt;li&gt;BenchLM: 60.9 (#48/200)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 86.7 (#62/416)&lt;/li&gt;&lt;li&gt;SpeechMap Compliance: 58.3 (#211/366)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.1V-9B&lt;/strong&gt; — ELO 1446, #504&lt;ul&gt;&lt;li&gt;Math-VR: 29.0 (#16/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (21)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on PLawBench: 70.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Roboflow Playground Classification: 1200.0 (#13)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Toolathlon: 77.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AIIQ Composite IQ: 134.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on MedCode: 63.57 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on MedScribe: 90.98 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on ProofBench: 78.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals Index: 74.82 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals Multimodal Index: 73.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on MathArena Apex: 69.79 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AIIQ Composite IQ: 136.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA-LCR: 74.7 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AIIQ Composite IQ: 122.0 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AutomationBench: 22.7 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on CritPt: 23.4 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Finance Agent v2: 54.36 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on MedCode: 48.88 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on MedScribe: 87.96 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on ProofBench: 70.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals Index: 74.7 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals Multimodal Index: 73.42 (#3)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (10)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;RuneBench&lt;/strong&gt;: Grok 4.6 (12757.0) beat Grok 4.5 by 4041.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (APEX-Agents)&lt;/strong&gt;: Grok 4.6 (57.5) beat Kimi K3 by 19.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (SVG)&lt;/strong&gt;: Claude Opus 5 (1381.0) beat GPT-5.6 Sol by 17.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;APEX-Agents-AA&lt;/strong&gt;: Claude Fable 5 (Max) (59.2) beat Gemini 3.5 Flash (High) by 12.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FrontierCode&lt;/strong&gt;: Claude Fable 5 (Max) (63.6) beat Claude Opus 5 by 10.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PLawBench&lt;/strong&gt;: Qwen 3.8 Max (73.2) beat GPT-5.2 by 3.53&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GameCraft-Bench&lt;/strong&gt;: Claude Opus 5 (68.44) beat Claude Fable 5 by 2.72&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Chess (Saplin)&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (1549.7) beat GPT-5.6 Sol (High) by 1.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA GPQA Diamond&lt;/strong&gt;: Grok 4.6 (High) (94.95) beat GPT-5.6 Sol (Max) by 0.81&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CursorBench 3.1&lt;/strong&gt;: Grok 4.6 Extra High (70.8) beat Claude Fable 5 (Max) by 0.3&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-13

=== DAILY ===
NEW BENCHMARKS (4)
  - Conceptual Reasoning Index (Chance-Corrected Score (0-100)): leader Claude Opus 5 (73.57), 134 models
      Redwood Research index for topics that cannot be graded against an answer key — AI alignment, collective action under tr</summary></entry><entry><title>The Aggregate Digest — 2026-08-12</title><id>https://theaggregate.ai/digest/2026-08-12</id><updated>2026-08-12T05:29:49.784589+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Chartography&lt;/strong&gt; (Score (%)): leader GPT-5.6 Sol (Max) (45.0), 40 models&lt;br&gt;&lt;span&gt;Surge AI professional chart-understanding benchmark covering Kaplan-Meier curves, candlestick charts, contour maps, Sankey diagrams, Bode plots, and other specialist graphics, scoring visual perception, domain-aware interpretation, and multi-step graphical reasoning.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;HANDBOOK.md Agents&lt;/strong&gt; (Score (%)): leader Claude Fable 5 (Adaptive/Max) (36.2), 37 models&lt;br&gt;&lt;span&gt;Surge AI long-context agentic instruction-following benchmark in which an agent must apply a 100-page company handbook inside a unique RL environment with internal tools and external MCP servers, across five enterprise domains.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ComplexConstraints&lt;/strong&gt; (Score (%)): leader GPT-5.6 Sol (Max) (50.5), 49 models&lt;br&gt;&lt;span&gt;Surge AI enterprise instruction-following benchmark whose constraints depend on one another, fire conditionally, and must be inferred from context rather than stated outright.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EnterpriseBench (CoreCraft Agents)&lt;/strong&gt; (Score (%)): leader Claude Fable 5 (Adaptive/Max) (70.3), 3 models&lt;br&gt;&lt;span&gt;Surge AI agentic benchmark set in CoreCraft, a large-scale simulated startup, measuring whether agents complete realistic enterprise tasks outside small self-contained environments.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (10)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Haiku 4.5 20251001 ThinkingAnthropic&lt;/strong&gt; — ELO 1602&lt;ul&gt;&lt;li&gt;MedScribe: 85.23 (#16/74)&lt;/li&gt;&lt;li&gt;MGSM: 92.15 (#22/74)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 42.88 (#26/29)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 56.48 (#30/54)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 46.93 (#34/53)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 31.01 (#35/40)&lt;/li&gt;&lt;li&gt;Vals Index: 40.9 (#35/40)&lt;/li&gt;&lt;li&gt;IOI: 6.17 (#46/64)&lt;/li&gt;&lt;li&gt;MedCode: 32.68 (#61/75)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.5 20250929 ThinkingAnthropic&lt;/strong&gt; — ELO 1682&lt;ul&gt;&lt;li&gt;MGSM: 94.33 (#4/74)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 54.5 (#18/53)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 62.16 (#19/54)&lt;/li&gt;&lt;li&gt;MedScribe: 84.1 (#20/74)&lt;/li&gt;&lt;li&gt;MedCode: 44.13 (#25/75)&lt;/li&gt;&lt;li&gt;IOI: 18.33 (#27/64)&lt;/li&gt;&lt;li&gt;ProofBench: 19.0 (#28/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Promax&lt;/strong&gt; — ELO 1707&lt;ul&gt;&lt;li&gt;Finance Agent v1.1: 60.39 (#5/53)&lt;/li&gt;&lt;li&gt;IOI: 35.83 (#17/64)&lt;/li&gt;&lt;li&gt;Vals Index: 55.62 (#19/40)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 44.08 (#24/40)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 59.38 (#27/54)&lt;/li&gt;&lt;li&gt;MedCode: 40.45 (#40/75)&lt;/li&gt;&lt;li&gt;ProofBench: 10.0 (#40/54)&lt;/li&gt;&lt;li&gt;MedScribe: 75.14 (#51/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLGLM 4.7Zhipu AI&lt;/strong&gt; — ELO 1605&lt;ul&gt;&lt;li&gt;CaseLaw v2: 54.88 (#37/54)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 45.98 (#38/53)&lt;/li&gt;&lt;li&gt;IOI: 7.58 (#41/64)&lt;/li&gt;&lt;li&gt;ProofBench: 6.0 (#45/54)&lt;/li&gt;&lt;li&gt;MGSM: 88.18 (#53/74)&lt;/li&gt;&lt;li&gt;MedCode: 32.77 (#60/75)&lt;/li&gt;&lt;li&gt;MedScribe: 68.63 (#68/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 ProGoogle&lt;/strong&gt; — ELO 1665&lt;ul&gt;&lt;li&gt;LingOly-TOO: 42.3539 (#4/16)&lt;/li&gt;&lt;li&gt;USAMO25: 24.4 (#5/13)&lt;/li&gt;&lt;li&gt;MedCode: 50.59 (#12/75)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 63.88 (#15/54)&lt;/li&gt;&lt;li&gt;IOI: 17.08 (#29/64)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 41.59 (#42/53)&lt;/li&gt;&lt;li&gt;HMMT 2025: 82.5 (#43/82)&lt;/li&gt;&lt;li&gt;MathArena Apex: 0.52 (#45/50)&lt;/li&gt;&lt;li&gt;MedScribe: 73.55 (#54/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Flash PreviewhighGoogle&lt;/strong&gt; — ELO 1689&lt;ul&gt;&lt;li&gt;MedCode: 55.92 (#4/75)&lt;/li&gt;&lt;li&gt;MGSM: 93.31 (#10/74)&lt;/li&gt;&lt;li&gt;IOI: 39.08 (#15/64)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 52.19 (#22/29)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 42.55 (#26/40)&lt;/li&gt;&lt;li&gt;Vals Index: 49.55 (#28/40)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 55.84 (#33/54)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 47.6 (#33/53)&lt;/li&gt;&lt;li&gt;ProofBench: 15.0 (#34/54)&lt;/li&gt;&lt;li&gt;MedScribe: 69.92 (#65/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Pro PreviewhighGoogle&lt;/strong&gt; — ELO 1708&lt;ul&gt;&lt;li&gt;MATH 500: 96.4 (#1/60)&lt;/li&gt;&lt;li&gt;MGSM: 93.93 (#7/74)&lt;/li&gt;&lt;li&gt;MedCode: 52.2 (#10/75)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 55.15 (#16/53)&lt;/li&gt;&lt;li&gt;IOI: 38.83 (#16/64)&lt;/li&gt;&lt;li&gt;ProofBench: 20.0 (#26/54)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 53.05 (#42/54)&lt;/li&gt;&lt;li&gt;MedScribe: 72.04 (#61/74)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KIkimi-k2.5&lt;/strong&gt; — ELO 1689&lt;ul&gt;&lt;li&gt;Hack-Verifiable TextArena: 19.0 (#6/12)&lt;/li&gt;&lt;li&gt;TutorBench: 54.56 (#6/27)&lt;/li&gt;&lt;li&gt;MultiNRC: 35.17 (#20/43)&lt;/li&gt;&lt;li&gt;EnigmaEval: 3.38 (#25/43)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 41.86 (#36/58)&lt;/li&gt;&lt;li&gt;ALE-Bench: 821.65 (#36/89)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 111.0 (#43/115)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KIkimi-k2.6&lt;/strong&gt; — ELO 1714&lt;ul&gt;&lt;li&gt;Personalized Turn-Level User Conversation Sati: 4.74 (#1/7)&lt;/li&gt;&lt;li&gt;RankJudge: 1713.0 (#4/21)&lt;/li&gt;&lt;li&gt;MathConstraint: 35.9 (#8/12)&lt;/li&gt;&lt;li&gt;From Knowing to Doing: -24.23 (#10/10)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1451.0 (#21/38)&lt;/li&gt;&lt;li&gt;ALE-Bench: 1092.67 (#21/89)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 119.0 (#22/115)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1509.0 (#27/48)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Glimmer-30B&lt;/strong&gt; — ELO 1663&lt;ul&gt;&lt;li&gt;LLM Stats (AIME 2026): 94.7 (#5/18)&lt;/li&gt;&lt;li&gt;LLM Stats (ScreenSpot Pro): 75.4 (#6/25)&lt;/li&gt;&lt;li&gt;LLM Stats (SkillsBench): 44.3 (#7/8)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSearchQA): 74.6 (#9/9)&lt;/li&gt;&lt;li&gt;LLM Stats (MCP Atlas): 75.5 (#12/32)&lt;/li&gt;&lt;li&gt;LLM Stats (OmniDocBench 1.5): 75.8 (#13/17)&lt;/li&gt;&lt;li&gt;LLM Stats (OSWorld-Verified): 65.9 (#17/23)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 51.7 (#19/19)&lt;/li&gt;&lt;li&gt;LLM Stats (CharXiv-R): 78.8 (#22/48)&lt;/li&gt;&lt;li&gt;LLM Stats Score: 35.64 (#65/326)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (32)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on ArxivMath: 87.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on MathArena Apex: 69.79 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on PM-LLM-Benchmark: 37.7 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on AIIQ Composite IQ: 136.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on AIIQ Composite IQ: 136.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on AIIQ Composite IQ: 136.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on APEX-Agents: 39.9 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on CharXiv-R: 84.6 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on Finance Agent v2: 55.04 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on Finance Agent v2: 55.04 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on Finance Agent v2: 55.04 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on IOI: 86.67 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on IOI: 86.67 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on IOI: 86.67 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on MCP Atlas: 83.6 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on MedCode: 43.97 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on MedCode: 43.97 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on MedCode: 43.97 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on MedScribe: 85.23 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on MedScribe: 85.23 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on MedScribe: 85.23 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on OmniDocBench 1.5: 85.8 (#41)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on ProofBench: 77.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on ProofBench: 77.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on ProofBench: 77.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on Toolathlon: 74.9 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on Vals Index: 73.12 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on Vals Index: 73.12 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on Vals Index: 73.12 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on Vals Multimodal Index: 72.19 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on Vals Multimodal Index: 72.19 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6&lt;/strong&gt; on Vals Multimodal Index: 72.19 (#4)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (10)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;OpenRouter BrowseComp (Search)&lt;/strong&gt;: Claude Opus 5 · high (89.0) beat GPT-5.6 Sol by 14.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Arena AI Code&lt;/strong&gt;: Claude Opus 5 (Max) (1692.0) beat Kimi K3 by 10.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LMArena WebDev Arena&lt;/strong&gt;: Claude Opus 5 (Max) (1691.77) beat Kimi K3 by 9.76&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenRouter HLE (Search)&lt;/strong&gt;: Claude Opus 5 · high (77.4) beat Claude Opus 5 by 4.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA-LCR&lt;/strong&gt;: Muse Glimmer 30B (80.0) beat GPT-5.2 Codex (xHigh) by 4.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Computer Anthology Terminal Tasks (Gemini CLI)&lt;/strong&gt;: Gemini 3.5 Flash (High) (24.4) beat Gemini 3.5 Flash by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ComplexFuncBench&lt;/strong&gt;: GPT-4o (66.5) beat GPT-4.1 by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProgramBench&lt;/strong&gt;: GPT-5.6 Sol (xHigh) (1.0) beat GPT-5.5 (xHigh) by 0.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Computer Anthology Terminal Tasks (Terminus-2)&lt;/strong&gt;: Claude Opus 5 (High) (62.0) beat Claude Opus 5 by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CPTU Bench&lt;/strong&gt;: Muse-Glimmer-30B reasoning (API, FP8) (4.42) beat Qwen3.5-27B thinking (API) by 0.08&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-12

=== DAILY ===
NEW BENCHMARKS (4)
  - Chartography (Score (%)): leader GPT-5.6 Sol (Max) (45.0), 40 models
      Surge AI professional chart-understanding benchmark covering Kaplan-Meier curves, candlestick charts, contour maps, Sankey diagrams, Bode plots, and othe</summary></entry><entry><title>The Aggregate Digest — 2026-08-11</title><id>https://theaggregate.ai/digest/2026-08-11</id><updated>2026-08-11T05:10:50.566795+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Humanity's Last Exam (Self-Reported, No Tools)&lt;/strong&gt; (Accuracy (%)): leader Kimi K3 (56.0), 44 models&lt;br&gt;&lt;span&gt;PhD-level questions at the frontier of human expert knowledge. Lab-submitted scores from the official cais/hle dataset board on Hugging Face (model-card numbers, none independently verified), No Tools configuration; mostly open-weights models.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on GDP.pdf: 34.2 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Riemann-bench: 34.2 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on GDP.pdf: 29.6 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Riemann-bench: 29.6 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on TrackingAI IQ Test (Vision): 88.24 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Riemann-bench: 39.5 (#2)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Slides)&lt;/strong&gt;: playyy (1310.0) beat manus by 67.0&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-11

=== DAILY ===
NEW BENCHMARKS (1)
  - Humanity's Last Exam (Self-Reported, No Tools) (Accuracy (%)): leader Kimi K3 (56.0), 44 models
      PhD-level questions at the frontier of human expert knowledge. Lab-submitted scores from the official cais/hle dataset board o</summary></entry><entry><title>The Aggregate Digest — 2026-08-10</title><id>https://theaggregate.ai/digest/2026-08-10</id><updated>2026-08-10T05:23:34.260300+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;Top-10 New Scores (13)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on AIIQ Composite IQ: 134.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals Index: 74.82 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Vals Multimodal Index: 73.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AIIQ Composite IQ: 122.0 (#26)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Finance Agent v2: 54.36 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on LMArena Text Arena: 1485.33 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on MedCode: 48.88 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on MedScribe: 87.96 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on ProofBench: 70.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals Index: 74.7 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Vals Multimodal Index: 73.42 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.2&lt;/strong&gt; on Roboflow Playground Object Detection: 1215.0 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.2&lt;/strong&gt; on Roboflow Playground Overall: 1215.0 (#16)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (6)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Arena AI Document&lt;/strong&gt;: Claude Opus 5 (High) (1520.0) beat Claude Opus 4.6 by 10.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MedCode&lt;/strong&gt;: Claude Opus 5 (63.57) beat Gemini 3.1 Pro (Preview) (High) by 4.51&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MedScribe&lt;/strong&gt;: Claude Opus 5 (90.98) beat Muse Spark 1.1 (xHigh) by 2.09&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProofBench&lt;/strong&gt;: Claude Opus 5 (78.0) beat Claude Fable 5 (Max) by 1.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Finance Agent v2&lt;/strong&gt;: Claude Opus 5 (Max) (58.63) beat Gemini 3.5 Flash by 0.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SpatialGen-Bench (Text Answering)&lt;/strong&gt;: Qwen 3.8 Max (81.74) beat Claude Fable 5 by 0.48&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-10

=== DAILY ===
NEW SCORES FROM TOP-10 MODELS (13)
  - Claude Opus 5 on AIIQ Composite IQ: 134.0 Composite IQ (self-reported) (#5/145)
  - Claude Opus 5 on Vals Index: 74.82 Score (self-reported) (#2/40)
  - Claude Opus 5 on Vals Multimodal Index: 73.9 Score (self-re</summary></entry><entry><title>The Aggregate Digest — 2026-08-09</title><id>https://theaggregate.ai/digest/2026-08-09</id><updated>2026-08-09T06:48:29.141755+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Coarena&lt;/strong&gt; (Elo (Bradley-Terry)): leader Claude Fable 5 (1079.1), 13 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Coarena - Task Completion&lt;/strong&gt; (Completion Rate (%)): leader GPT-5.6 Terra (81.4), 13 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Featherbench&lt;/strong&gt; (Pass Rate (%)): leader Gemini 3.6 Flash (96.0), 13 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Featherbench - Rubric Quality&lt;/strong&gt; (Rubric Score (0-10)): leader Kimi K3 (9.5), 13 models&lt;/li&gt;&lt;/ul&gt;
&lt;hr/&gt;
&lt;h2&gt;Weekly&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Coarena&lt;/strong&gt; (Elo (Bradley-Terry)): leader Claude Fable 5 (1079.1), 13 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Coarena - Task Completion&lt;/strong&gt; (Completion Rate (%)): leader GPT-5.6 Terra (81.4), 13 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Featherbench&lt;/strong&gt; (Pass Rate (%)): leader Gemini 3.6 Flash (96.0), 13 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Featherbench - Rubric Quality&lt;/strong&gt; (Rubric Score (0-10)): leader Kimi K3 (9.5), 13 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (470)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; — ELO 1778, #1&lt;ul&gt;&lt;li&gt;TaxBench: 29.27 (#1/16)&lt;/li&gt;&lt;li&gt;GDPval-MM: 82.3 (#2/14)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 92.7 (#11/406)&lt;/li&gt;&lt;li&gt;BLXBench: 44.5 (#14/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; — ELO 1776, #2&lt;ul&gt;&lt;li&gt;FrontierCode: 53.4 (#1/21)&lt;/li&gt;&lt;li&gt;Harvey Legal Agent Benchmark: 23.58 (#1/12)&lt;/li&gt;&lt;li&gt;Toolathlon: 80.6 (#1/39)&lt;/li&gt;&lt;li&gt;ArxivMath: 91.33 (#1/20)&lt;/li&gt;&lt;li&gt;ProteinGym Hard: 47.7 (#1/7)&lt;/li&gt;&lt;li&gt;InferenceBench: 8.9 (#1/29)&lt;/li&gt;&lt;li&gt;Design Arena (Game Dev): 1426.0 (#1/150)&lt;/li&gt;&lt;li&gt;MCP Atlas: 85.8 (#2/42)&lt;/li&gt;&lt;li&gt;Tau3-Bench Banking_Knowledge: 48.7 (#2/28)&lt;/li&gt;&lt;li&gt;INCLUDE: 89.8 (#4/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; — ELO 1774, #3&lt;ul&gt;&lt;li&gt;CAIS Risk Index: 27.3 (#1/45)&lt;/li&gt;&lt;li&gt;EQ-Bench: 2049.7 (#1/79)&lt;/li&gt;&lt;li&gt;MirrorCode: 63.9 (#1/4)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 98.9 (#1/13)&lt;/li&gt;&lt;li&gt;Crosby micro1 RedlineBench: 47.3 (#2/5)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 2156.3 (#2/123)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1505.0 (#2/27)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1630.0 (#2/42)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1629.56 (#2/22)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 85.0 (#2/30)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; — ELO 1766, #4&lt;ul&gt;&lt;li&gt;Creative Writing v3: 2208.0 (#1/123)&lt;/li&gt;&lt;li&gt;Graphwalks BFS 1M F1: 83.4 (#1/10)&lt;/li&gt;&lt;li&gt;Graphwalks BFS 256k F1: 95.4 (#1/10)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 100.0 (#1/13)&lt;/li&gt;&lt;li&gt;PLawBench: 72.3 (#2/29)&lt;/li&gt;&lt;li&gt;MirrorCode: 20.0 (#2/4)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - CLIcK: 95.5 (#2/8)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - HAE-RAE Bench: 94.64 (#2/8)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - KMMLU-HARD: 85.04 (#2/8)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 97.8 (#3/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro (xHigh)&lt;/strong&gt; — ELO 1758, #5&lt;ul&gt;&lt;li&gt;EnigmaEval: 23.82 (#1/39)&lt;/li&gt;&lt;li&gt;BilliardPhys-Bench: 72.29 (#2/13)&lt;/li&gt;&lt;li&gt;MathArena Apex: 69.79 (#2/51)&lt;/li&gt;&lt;li&gt;TutorBench: 56.62 (#2/23)&lt;/li&gt;&lt;li&gt;TaxBench: 27.03 (#2/16)&lt;/li&gt;&lt;li&gt;MultiNRC: 62.27 (#3/39)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 53.89 (#3/54)&lt;/li&gt;&lt;li&gt;CritPt: 30.0 (#3/342)&lt;/li&gt;&lt;li&gt;ARC-AGI-2: 83.33 (#15/202)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 91.9 (#18/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; — ELO 1755, #6&lt;ul&gt;&lt;li&gt;Arena AI Code: 1682.0 (#1/42)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1682.01 (#1/22)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 58.68 (#3/128)&lt;/li&gt;&lt;li&gt;GameCraft-Bench: 56.96 (#3/11)&lt;/li&gt;&lt;li&gt;AA-LCR: 74.7 (#4/355)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test: 93.75 (#4/39)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test (Vision): 88.0 (#4/25)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 93.3 (#9/13)&lt;/li&gt;&lt;li&gt;CritPt: 23.4 (#10/342)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 97.8 (#10/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; — ELO 1755, #7&lt;ul&gt;&lt;li&gt;PLawBench: 73.2 (#1/29)&lt;/li&gt;&lt;li&gt;Tau3 Banking: 51.34 (#1/188)&lt;/li&gt;&lt;li&gt;Tau3-Bench Banking_Knowledge: 55.2 (#1/28)&lt;/li&gt;&lt;li&gt;LLM Stats (ERQA): 77.8 (#1/23)&lt;/li&gt;&lt;li&gt;LLM Stats (HealthBench): 60.2 (#1/9)&lt;/li&gt;&lt;li&gt;LLM Stats (LongBench v2): 66.3 (#1/17)&lt;/li&gt;&lt;li&gt;LLM Stats (LVBench): 81.8 (#1/24)&lt;/li&gt;&lt;li&gt;LLM Stats (NL2Repo): 55.9 (#1/14)&lt;/li&gt;&lt;li&gt;LLM Stats (OSWorld-Verified): 86.1 (#1/22)&lt;/li&gt;&lt;li&gt;LLM Stats (RealWorldQA): 88.0 (#1/26)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.2&lt;/strong&gt; — ELO 1750, #8&lt;ul&gt;&lt;li&gt;ErdosBench: 2.73 (#3/9)&lt;/li&gt;&lt;li&gt;Design Arena (Data Viz): 1361.0 (#3/147)&lt;/li&gt;&lt;li&gt;Design Arena (Game Dev): 1375.0 (#4/150)&lt;/li&gt;&lt;li&gt;Design Arena (UI Components): 1368.0 (#4/145)&lt;/li&gt;&lt;li&gt;Design Arena (Website): 1331.0 (#5/164)&lt;/li&gt;&lt;li&gt;Design Arena (3D): 1364.0 (#5/140)&lt;/li&gt;&lt;li&gt;Vals AI (Vals Index): 71.88 (#5/45)&lt;/li&gt;&lt;li&gt;Vals AI Multimodal Index: 69.8 (#6/32)&lt;/li&gt;&lt;li&gt;DeepSWE: 54.9 (#14/25)&lt;/li&gt;&lt;li&gt;MineBench: 1505.11 (#21/58)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5&lt;/strong&gt; — ELO 1747, #9&lt;ul&gt;&lt;li&gt;CombEval: 93.6 (#1/11)&lt;/li&gt;&lt;li&gt;Crosby micro1 RedlineBench: 50.5 (#1/5)&lt;/li&gt;&lt;li&gt;MUSE: 67.14 (#1/15)&lt;/li&gt;&lt;li&gt;MathConstraint: 66.9 (#1/12)&lt;/li&gt;&lt;li&gt;GDPval-MM: 84.9 (#1/14)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 136.0 (#1/138)&lt;/li&gt;&lt;li&gt;From Knowing to Doing: 61.26 (#2/10)&lt;/li&gt;&lt;li&gt;DiscoverPhysics: 59.0 (#2/11)&lt;/li&gt;&lt;li&gt;RankJudge: 1867.0 (#2/21)&lt;/li&gt;&lt;li&gt;JuICE: 49.67 (#3/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.6 Flash&lt;/strong&gt; — ELO 1743, #10&lt;ul&gt;&lt;li&gt;MRCR-v2 128k: 91.8 (#1/18)&lt;/li&gt;&lt;li&gt;ProphetArena: 0.9638 (#1/23)&lt;/li&gt;&lt;li&gt;MMOU: 82.5 (#2/25)&lt;/li&gt;&lt;li&gt;Icelandic LLM - WikiQA-IS: 62.58 (#6/93)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 83.0 (#7/30)&lt;/li&gt;&lt;li&gt;Icelandic LLM - WinoGrande-IS: 95.5 (#7/93)&lt;/li&gt;&lt;li&gt;Icelandic LLM - Belebele-IS: 94.11 (#7/93)&lt;/li&gt;&lt;li&gt;Icelandic LLM Leaderboard - Average: 86.68 (#8/93)&lt;/li&gt;&lt;li&gt;Icelandic LLM - ARC-Challenge-IS: 94.88 (#8/93)&lt;/li&gt;&lt;li&gt;Icelandic LLM - GED: 76.5 (#9/93)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.1&lt;/strong&gt; — ELO 1743, #11&lt;ul&gt;&lt;li&gt;CAIS Risk Index: 34.2 (#2/45)&lt;/li&gt;&lt;li&gt;Toolathlon: 75.6 (#6/39)&lt;/li&gt;&lt;li&gt;Tau3-Bench Banking_Knowledge: 40.5 (#6/28)&lt;/li&gt;&lt;li&gt;Epoch AI - Vending Bench 2: 6520.47 (#9/57)&lt;/li&gt;&lt;li&gt;CAIS Vision Capabilities Index: 57.5 (#10/35)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1536.0 (#11/42)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1536.32 (#11/22)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 116.0 (#36/138)&lt;/li&gt;&lt;li&gt;Roboflow Playground Captioning: 1188.0 (#39/48)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Max&lt;/strong&gt; — ELO 1737, #12&lt;ul&gt;&lt;li&gt;HMMT February 2026: 97.1 (#1/25)&lt;/li&gt;&lt;li&gt;IMO-AnswerBench: 90.0 (#3/22)&lt;/li&gt;&lt;li&gt;ITBench-AA: 42.5 (#3/23)&lt;/li&gt;&lt;li&gt;MRCR-v2 128k: 90.4 (#3/18)&lt;/li&gt;&lt;li&gt;ResearchClawBench: 18.7 (#4/20)&lt;/li&gt;&lt;li&gt;MathArena Apex: 44.5 (#5/51)&lt;/li&gt;&lt;li&gt;When Safe Skills Collide: 1.0 (#7/9)&lt;/li&gt;&lt;li&gt;NL2Repo: 47.2 (#7/20)&lt;/li&gt;&lt;li&gt;MLS-Bench Lite: 31.7 (#9/10)&lt;/li&gt;&lt;li&gt;INCLUDE: 86.2 (#10/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Pro (Preview)&lt;/strong&gt; — ELO 1736, #13&lt;ul&gt;&lt;li&gt;AGORA: 59.39 (#1/8)&lt;/li&gt;&lt;li&gt;AgentCIBench: 98.3 (#1/15)&lt;/li&gt;&lt;li&gt;MMGist: 66.8 (#1/27)&lt;/li&gt;&lt;li&gt;PlanBench-XL: 77.06 (#1/10)&lt;/li&gt;&lt;li&gt;Trip+: 73.31 (#1/18)&lt;/li&gt;&lt;li&gt;LaViSA: 88.9 (#1/10)&lt;/li&gt;&lt;li&gt;GRACE: 81.46 (#1/13)&lt;/li&gt;&lt;li&gt;SpatialAct: 20.6 (#1/7)&lt;/li&gt;&lt;li&gt;NICE: 78.1 (#1/6)&lt;/li&gt;&lt;li&gt;IFMTBench: 89.08 (#1/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.8&lt;/strong&gt; — ELO 1731, #14&lt;ul&gt;&lt;li&gt;Agentic Skills Evaluation Framework: 92.7 (#1/19)&lt;/li&gt;&lt;li&gt;MyPCBench: 62.0 (#1/11)&lt;/li&gt;&lt;li&gt;CAIS Text Capabilities Index: 53.8 (#2/40)&lt;/li&gt;&lt;li&gt;EQ-Bench: 2029.8 (#2/79)&lt;/li&gt;&lt;li&gt;CAIS Risk Index: 39.6 (#4/45)&lt;/li&gt;&lt;li&gt;Crosby micro1 RedlineBench: 44.4 (#5/5)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1943.4 (#5/123)&lt;/li&gt;&lt;li&gt;Harvey Legal Agent Benchmark: 10.4 (#5/12)&lt;/li&gt;&lt;li&gt;PLawBench: 69.6 (#5/29)&lt;/li&gt;&lt;li&gt;ROSE: 24.3 (#6/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash&lt;/strong&gt; — ELO 1730, #15&lt;ul&gt;&lt;li&gt;SearchGEO: 25.8 (#2/13)&lt;/li&gt;&lt;li&gt;PlanBench-XL: 52.19 (#3/10)&lt;/li&gt;&lt;li&gt;MMOU: 81.9 (#3/25)&lt;/li&gt;&lt;li&gt;Crosby micro1 RedlineBench: 45.1 (#4/5)&lt;/li&gt;&lt;li&gt;ZeroBench: 22.0 (#6/69)&lt;/li&gt;&lt;li&gt;MRCR-v2 128k: 77.3 (#8/18)&lt;/li&gt;&lt;li&gt;ResearchClawBench: 17.9 (#9/20)&lt;/li&gt;&lt;li&gt;ArxivMath: 44.17 (#18/20)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1493.0 (#21/42)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 122.0 (#23/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.5&lt;/strong&gt; — ELO 1728, #16&lt;ul&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 100.0 (#2/13)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 97.8 (#2/13)&lt;/li&gt;&lt;li&gt;Tau3-Bench Banking_Knowledge: 47.9 (#3/28)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 96.6 (#6/13)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1550.0 (#7/42)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1550.2 (#7/22)&lt;/li&gt;&lt;li&gt;CAIS Vision Capabilities Index: 60.8 (#7/35)&lt;/li&gt;&lt;li&gt;MRCR-v2 128k: 81.4 (#7/18)&lt;/li&gt;&lt;li&gt;CAIS Risk Index: 52.2 (#17/45)&lt;/li&gt;&lt;li&gt;CharXiv-R: 81.6 (#22/60)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Terra&lt;/strong&gt; — ELO 1727, #17&lt;ul&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 100.0 (#1/13)&lt;/li&gt;&lt;li&gt;Graphwalks BFS 256k F1: 94.9 (#2/10)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 98.9 (#2/13)&lt;/li&gt;&lt;li&gt;Graphwalks BFS 1M F1: 75.5 (#3/10)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - CLIcK: 92.24 (#3/8)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - KMMLU-HARD: 77.86 (#3/8)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - HAE-RAE Bench: 92.85 (#5/8)&lt;/li&gt;&lt;li&gt;Rogo Big Finance Bench: 51.0 (#6/14)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1927.6 (#7/123)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 97.8 (#9/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.1 Pro&lt;/strong&gt; — ELO 1727, #18&lt;ul&gt;&lt;li&gt;LVBench: 78.0 (#1/49)&lt;/li&gt;&lt;li&gt;NL2Repo: 47.0 (#8/20)&lt;/li&gt;&lt;li&gt;CharXiv-R: 86.4 (#8/60)&lt;/li&gt;&lt;li&gt;CyberGym: 70.2 (#9/15)&lt;/li&gt;&lt;li&gt;MathArena Apex: 31.3 (#12/51)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1528.0 (#12/42)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1528.27 (#12/22)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Pro&lt;/strong&gt; — ELO 1718, #19&lt;ul&gt;&lt;li&gt;LiveK12Bench: 88.3 (#1/12)&lt;/li&gt;&lt;li&gt;WildRoadBench: 42.1 (#1/25)&lt;/li&gt;&lt;li&gt;BacktestBench: 67.41 (#1/23)&lt;/li&gt;&lt;li&gt;PaliBench: 94.6 (#1/10)&lt;/li&gt;&lt;li&gt;PrivacySIM: 40.39 (#1/6)&lt;/li&gt;&lt;li&gt;SpatialBabel: 83.4 (#1/14)&lt;/li&gt;&lt;li&gt;Omni-DeepSearch: 43.44 (#1/12)&lt;/li&gt;&lt;li&gt;Soohak: 44.12 (#1/11)&lt;/li&gt;&lt;li&gt;DiffCap-Bench: 83.1 (#1/16)&lt;/li&gt;&lt;li&gt;ADBench: 83.0 (#1/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2 Pro&lt;/strong&gt; — ELO 1717, #20&lt;ul&gt;&lt;li&gt;HMMT 2025: 100.0 (#1/89)&lt;/li&gt;&lt;li&gt;DEEPSYNTH: 8.7 (#2/11)&lt;/li&gt;&lt;li&gt;BilliardPhys-Bench: 62.34 (#3/13)&lt;/li&gt;&lt;li&gt;TaxBench: 17.77 (#7/16)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 90.5 (#27/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Pro (Preview)&lt;/strong&gt; — ELO 1716, #21&lt;ul&gt;&lt;li&gt;LongWebBench: 7.22 (#1/13)&lt;/li&gt;&lt;li&gt;Checkup2Action: 60.2 (#1/8)&lt;/li&gt;&lt;li&gt;Magis-Bench: 6.97 (#1/23)&lt;/li&gt;&lt;li&gt;SciPredict: 25.27 (#1/15)&lt;/li&gt;&lt;li&gt;PlaceboBench: 73.91 (#1/7)&lt;/li&gt;&lt;li&gt;ATC Safety-Oriented Language Understanding Eval: 68.84 (#2/11)&lt;/li&gt;&lt;li&gt;Omi SOAP Note Safety Benchmark: 4.7 (#2/6)&lt;/li&gt;&lt;li&gt;MechVQA: 77.28 (#3/17)&lt;/li&gt;&lt;li&gt;EnigmaEval: 18.24 (#4/39)&lt;/li&gt;&lt;li&gt;VTB: 26.85 (#4/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4&lt;/strong&gt; — ELO 1715, #22&lt;ul&gt;&lt;li&gt;BehaviorBench: 31.4 (#1/20)&lt;/li&gt;&lt;li&gt;Geo-Eval: 7.15 (#1/11)&lt;/li&gt;&lt;li&gt;Vision2Code: 4.12 (#1/11)&lt;/li&gt;&lt;li&gt;TriBench-Ko: 83.5 (#1/13)&lt;/li&gt;&lt;li&gt;VTB: 29.17 (#1/17)&lt;/li&gt;&lt;li&gt;DiagnosticIQ: 73.27 (#2/33)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 134.0 (#2/138)&lt;/li&gt;&lt;li&gt;SmellBench: 42.8 (#3/9)&lt;/li&gt;&lt;li&gt;MirrorCode: 15.6 (#3/4)&lt;/li&gt;&lt;li&gt;FAM-Bench: 82.4 (#4/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.7&lt;/strong&gt; — ELO 1711, #23&lt;ul&gt;&lt;li&gt;DiscoverPhysics: 61.0 (#1/11)&lt;/li&gt;&lt;li&gt;EvoCode-Bench: 54.0 (#1/13)&lt;/li&gt;&lt;li&gt;RoadmapBench: 39.1 (#1/13)&lt;/li&gt;&lt;li&gt;Are LLMs Ready to Assist Physicians? PhysAssis: 68.3 (#2/14)&lt;/li&gt;&lt;li&gt;ResearchClawBench: 20.7 (#2/20)&lt;/li&gt;&lt;li&gt;IntentGrasp: 57.31 (#2/20)&lt;/li&gt;&lt;li&gt;Causal Sensitivity Score (CSS): 43.2 (#3/6)&lt;/li&gt;&lt;li&gt;MUSE: 53.46 (#3/15)&lt;/li&gt;&lt;li&gt;ProactBench: 51.9 (#3/16)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 2083.1 (#3/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.1 Turbo&lt;/strong&gt; — ELO 1710, #24&lt;ul&gt;&lt;li&gt;LVBench: 76.8 (#3/49)&lt;/li&gt;&lt;li&gt;MathArena Apex: 35.4 (#8/51)&lt;/li&gt;&lt;li&gt;NL2Repo: 43.7 (#9/20)&lt;/li&gt;&lt;li&gt;CyberGym: 67.0 (#11/15)&lt;/li&gt;&lt;li&gt;CharXiv-R: 83.6 (#18/60)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 5&lt;/strong&gt; — ELO 1707, #25&lt;ul&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 97.8 (#5/13)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 98.9 (#6/13)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 96.6 (#7/13)&lt;/li&gt;&lt;li&gt;InferenceBench: 6.43 (#9/29)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1827.4 (#11/123)&lt;/li&gt;&lt;li&gt;MRCR-v2 128k: 71.6 (#11/18)&lt;/li&gt;&lt;li&gt;TrackingAI IQ Test (Mensa Norway): 80.0 (#17/38)&lt;/li&gt;&lt;li&gt;Epoch AI - Mystery Game Puzzles: 16.0 (#37/47)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Pro&lt;/strong&gt; — ELO 1707, #26&lt;ul&gt;&lt;li&gt;MultiNRC: 65.2 (#1/39)&lt;/li&gt;&lt;li&gt;EnigmaEval: 18.75 (#3/39)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 52.39 (#4/54)&lt;/li&gt;&lt;li&gt;LiveBench: 71.29 (#29/43)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 88.7 (#51/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.2&lt;/strong&gt; — ELO 1706, #27&lt;ul&gt;&lt;li&gt;Spider 2.0-Lite: 76.23 (#1/37)&lt;/li&gt;&lt;li&gt;IMO-AnswerBench: 91.0 (#2/22)&lt;/li&gt;&lt;li&gt;Crosby micro1 RedlineBench: 45.7 (#3/5)&lt;/li&gt;&lt;li&gt;CAIS Risk Index: 42.4 (#6/45)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1575.1 (#8/79)&lt;/li&gt;&lt;li&gt;HMMT February 2026: 92.5 (#8/25)&lt;/li&gt;&lt;li&gt;FrontierCode: 24.5 (#12/21)&lt;/li&gt;&lt;li&gt;ArxivMath: 56.67 (#13/20)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1745.8 (#15/123)&lt;/li&gt;&lt;li&gt;HMMT 2025: 94.4 (#20/89)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Luna&lt;/strong&gt; — ELO 1706, #28&lt;ul&gt;&lt;li&gt;Graphwalks BFS 256k F1: 92.5 (#3/10)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - HAE-RAE Bench: 93.17 (#3/8)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - CLIcK: 91.53 (#5/8)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - KMMLU-HARD: 75.76 (#5/8)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1932.2 (#6/123)&lt;/li&gt;&lt;li&gt;Graphwalks BFS 1M F1: 56.8 (#7/10)&lt;/li&gt;&lt;li&gt;MRCR-v2 128k: 74.8 (#9/18)&lt;/li&gt;&lt;li&gt;Toolathlon: 74.6 (#11/39)&lt;/li&gt;&lt;li&gt;CAIS Vision Capabilities Index: 55.5 (#12/35)&lt;/li&gt;&lt;li&gt;Rogo Big Finance Bench: 36.0 (#12/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2 Codex&lt;/strong&gt; — ELO 1706, #29&lt;ul&gt;&lt;li&gt;MolViBench: 33.2 (#8/13)&lt;/li&gt;&lt;li&gt;LiveBench: 74.33 (#19/43)&lt;/li&gt;&lt;li&gt;Mercor APEX: 27.6 (#20/53)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 Max Preview&lt;/strong&gt; — ELO 1705, #30&lt;ul&gt;&lt;li&gt;Qwen-AgentWorld: 52.42 (#11/16)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1478.0 (#23/42)&lt;/li&gt;&lt;li&gt;AA-LCR: 69.7 (#26/355)&lt;/li&gt;&lt;li&gt;ClawProBench: 57.4 (#26/57)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 52.78 (#28/56)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 47.91 (#51/54)&lt;/li&gt;&lt;li&gt;CritPt: 3.7 (#56/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.6&lt;/strong&gt; — ELO 1704, #31&lt;ul&gt;&lt;li&gt;EComAgentBench: 57.1 (#1/7)&lt;/li&gt;&lt;li&gt;MineExplorer: 41.08 (#1/18)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 50.3 (#1/35)&lt;/li&gt;&lt;li&gt;HIDBench: 60.2 (#1/9)&lt;/li&gt;&lt;li&gt;STT-Arena: 35.39 (#1/23)&lt;/li&gt;&lt;li&gt;TraceEval: 72.9 (#1/10)&lt;/li&gt;&lt;li&gt;DiagnosticIQ: 73.59 (#1/33)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1510.0 (#1/27)&lt;/li&gt;&lt;li&gt;JamSet/JamBench: 42.0 (#2/9)&lt;/li&gt;&lt;li&gt;MedCTA: 31.32 (#2/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Flash (Preview)&lt;/strong&gt; — ELO 1704, #32&lt;ul&gt;&lt;li&gt;CulMind: 50.7 (#1/14)&lt;/li&gt;&lt;li&gt;ATC Safety-Oriented Language Understanding Eval: 69.22 (#1/11)&lt;/li&gt;&lt;li&gt;JuICE: 52.14 (#2/10)&lt;/li&gt;&lt;li&gt;GlobalDentBench: 61.59 (#2/12)&lt;/li&gt;&lt;li&gt;CPCD-Bench: 4.46 (#2/14)&lt;/li&gt;&lt;li&gt;CiteVQA: 45.4 (#2/20)&lt;/li&gt;&lt;li&gt;Magis-Bench: 6.67 (#2/23)&lt;/li&gt;&lt;li&gt;LongWebBench: 6.53 (#3/13)&lt;/li&gt;&lt;li&gt;BilliardPhys-Bench: 58.06 (#4/13)&lt;/li&gt;&lt;li&gt;PlaceboBench: 44.93 (#5/7)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.3 Codex&lt;/strong&gt; — ELO 1704, #33&lt;ul&gt;&lt;li&gt;Time to REFLECT: 47.5 (#1/14)&lt;/li&gt;&lt;li&gt;Verus-SpecBench: 57.8 (#2/6)&lt;/li&gt;&lt;li&gt;AgentTrap: 55.0 (#6/8)&lt;/li&gt;&lt;li&gt;Boiling the Frog: 23.1 (#7/9)&lt;/li&gt;&lt;li&gt;SWE Atlas: 32.6 (#7/15)&lt;/li&gt;&lt;li&gt;LiveSQLBench: 33.33 (#8/33)&lt;/li&gt;&lt;li&gt;gwBenchmarks: 17.8 (#9/12)&lt;/li&gt;&lt;li&gt;MolViBench: 32.7 (#9/13)&lt;/li&gt;&lt;li&gt;OpenSkillEval: 3.76 (#10/10)&lt;/li&gt;&lt;li&gt;Mercor APEX: 31.8 (#18/53)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3 Flash&lt;/strong&gt; — ELO 1701, #34&lt;ul&gt;&lt;li&gt;OCR-Robust: 80.71 (#1/16)&lt;/li&gt;&lt;li&gt;P3B3: 99.8 (#1/20)&lt;/li&gt;&lt;li&gt;SearchGEO: 31.4 (#1/13)&lt;/li&gt;&lt;li&gt;Scammer4U: 93.1 (#1/4)&lt;/li&gt;&lt;li&gt;ERGeoBench: 8.83 (#1/9)&lt;/li&gt;&lt;li&gt;A Matter of TASTE: 82.0 (#1/6)&lt;/li&gt;&lt;li&gt;Plant, Persist, Trigger: 51.1 (#1/7)&lt;/li&gt;&lt;li&gt;StreamProfileBench: 54.97 (#1/14)&lt;/li&gt;&lt;li&gt;ChartFI: 3.49 (#1/5)&lt;/li&gt;&lt;li&gt;Perception or Prejudice: 33.5 (#1/27)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok Build 0.1&lt;/strong&gt; — ELO 1700, #35&lt;ul&gt;&lt;li&gt;CritPt: 9.1 (#30/342)&lt;/li&gt;&lt;li&gt;LiveBench: 69.59 (#35/43)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 50.23 (#35/128)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 9.14 (#47/138)&lt;/li&gt;&lt;li&gt;AA-LCR: 64.7 (#71/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.7 Plus&lt;/strong&gt; — ELO 1699, #36&lt;ul&gt;&lt;li&gt;LVBench: 76.2 (#4/49)&lt;/li&gt;&lt;li&gt;IMO-AnswerBench: 86.0 (#7/22)&lt;/li&gt;&lt;li&gt;OmniDocBench 1.5: 91.4 (#9/64)&lt;/li&gt;&lt;li&gt;CharXiv-R: 85.9 (#9/60)&lt;/li&gt;&lt;li&gt;NL2Repo: 41.1 (#13/20)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1442.0 (#16/27)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 53.89 (#16/26)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 73.3 (#18/30)&lt;/li&gt;&lt;li&gt;Vals Index: 52.33 (#20/35)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 38.22 (#28/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.7 Code&lt;/strong&gt; — ELO 1698, #37&lt;ul&gt;&lt;li&gt;FrontierCode: 30.1 (#9/21)&lt;/li&gt;&lt;li&gt;InferenceBench: 6.27 (#10/29)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1474.0 (#25/42)&lt;/li&gt;&lt;li&gt;CritPt: 10.0 (#27/342)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 117.0 (#34/138)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 47.45 (#49/128)&lt;/li&gt;&lt;li&gt;AA-LCR: 66.3 (#54/355)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 54.1 (#222/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro (Preview 06-05)&lt;/strong&gt; — ELO 1694, #38&lt;ul&gt;&lt;li&gt;Visual-Language Understanding: 54.63 (#2/54)&lt;/li&gt;&lt;li&gt;Balrog: 43.3 (#2/16)&lt;/li&gt;&lt;li&gt;CadEval: 64.0 (#2/10)&lt;/li&gt;&lt;li&gt;TutorBench: 55.65 (#3/23)&lt;/li&gt;&lt;li&gt;VTB: 11.75 (#7/17)&lt;/li&gt;&lt;li&gt;MultiNRC: 45.12 (#13/39)&lt;/li&gt;&lt;li&gt;EnigmaEval: 5.57 (#19/39)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1545.0 (#19/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1391.7 (#58/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nex N2 Pro&lt;/strong&gt; — ELO 1693, #39&lt;ul&gt;&lt;li&gt;CritPt: 8.6 (#34/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 67.7 (#42/355)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 110.0 (#59/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2&lt;/strong&gt; — ELO 1692, #40&lt;ul&gt;&lt;li&gt;TriggerBench: 90.88 (#1/14)&lt;/li&gt;&lt;li&gt;EHRBench: 70.91 (#1/31)&lt;/li&gt;&lt;li&gt;MolDeTox: 15.59 (#1/15)&lt;/li&gt;&lt;li&gt;Omi SOAP Note Safety Benchmark: 4.72 (#1/6)&lt;/li&gt;&lt;li&gt;Poker Agent: 1131.83 (#1/17)&lt;/li&gt;&lt;li&gt;C3-Bench: 5.72 (#2/33)&lt;/li&gt;&lt;li&gt;Polaris-Bench: 77.4 (#2/15)&lt;/li&gt;&lt;li&gt;DiffCap-Bench: 75.1 (#2/16)&lt;/li&gt;&lt;li&gt;IDE-Bench: 85.0 (#2/15)&lt;/li&gt;&lt;li&gt;PlaceboBench: 63.24 (#2/7)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash (0731)&lt;/strong&gt; — ELO 1692, #41&lt;ul&gt;&lt;li&gt;LLM Stats (NL2Repo): 54.2 (#2/14)&lt;/li&gt;&lt;li&gt;LLM Stats (AutomationBench): 25.1 (#3/8)&lt;/li&gt;&lt;li&gt;LLM Stats (Toolathlon): 70.3 (#3/31)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - HAE-RAE Bench: 92.98 (#4/8)&lt;/li&gt;&lt;li&gt;LLM Stats (CyberGym): 76.7 (#5/11)&lt;/li&gt;&lt;li&gt;LLM Stats (DeepSWE): 54.4 (#5/10)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - CLIcK: 90.78 (#6/8)&lt;/li&gt;&lt;li&gt;Korean LLM Eval - KMMLU-HARD: 74.2 (#6/8)&lt;/li&gt;&lt;li&gt;KernelBench Hub - CUDA: 14.53 (#7/8)&lt;/li&gt;&lt;li&gt;LLM Stats (Terminal-Bench 2.1): 82.7 (#8/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5&lt;/strong&gt; — ELO 1691, #42&lt;ul&gt;&lt;li&gt;GraphARC: 91.0 (#1/11)&lt;/li&gt;&lt;li&gt;Fin-RATE: 43.37 (#1/16)&lt;/li&gt;&lt;li&gt;Seneca-TRBench: 93.5 (#1/5)&lt;/li&gt;&lt;li&gt;IneqMath: 47.0 (#1/42)&lt;/li&gt;&lt;li&gt;AfroBench-Lite: 77.74 (#1/24)&lt;/li&gt;&lt;li&gt;TW-LegalBench: 76.7 (#2/13)&lt;/li&gt;&lt;li&gt;EHRBench: 69.06 (#3/31)&lt;/li&gt;&lt;li&gt;Xent Games: 62.77 (#3/12)&lt;/li&gt;&lt;li&gt;Causal Sensitivity Score (CSS): 42.7 (#4/6)&lt;/li&gt;&lt;li&gt;TutorBench: 55.33 (#4/23)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.0 Pro&lt;/strong&gt; — ELO 1691, #43&lt;ul&gt;&lt;li&gt;VisualNeedle: 36.8 (#3/9)&lt;/li&gt;&lt;li&gt;Trip+: 64.74 (#7/18)&lt;/li&gt;&lt;li&gt;BilliardPhys-Bench: 48.46 (#7/13)&lt;/li&gt;&lt;li&gt;GlobalDentBench: 55.77 (#7/12)&lt;/li&gt;&lt;li&gt;MedBench v5: 92.44 (#9/10)&lt;/li&gt;&lt;li&gt;MineExplorer: 15.5 (#9/18)&lt;/li&gt;&lt;li&gt;SGR-Bench: 29.88 (#10/11)&lt;/li&gt;&lt;li&gt;ClawProBench: 61.07 (#10/57)&lt;/li&gt;&lt;li&gt;RoadmapBench: 5.2 (#13/13)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 59.5 (#29/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.6&lt;/strong&gt; — ELO 1690, #44&lt;ul&gt;&lt;li&gt;Personalized Turn-Level User Conversation Sati: 4.74 (#1/7)&lt;/li&gt;&lt;li&gt;ContextEcho: 100.0 (#1/23)&lt;/li&gt;&lt;li&gt;Greenland Sovereignty Game (implicitly as a st: 22.0 (#1/8)&lt;/li&gt;&lt;li&gt;OJBench: 60.6 (#1/44)&lt;/li&gt;&lt;li&gt;IOI: 585.0 (#1/58)&lt;/li&gt;&lt;li&gt;MedBench v5: 96.49 (#2/10)&lt;/li&gt;&lt;li&gt;Trip+: 67.5 (#3/18)&lt;/li&gt;&lt;li&gt;EComAgentBench: 46.4 (#3/7)&lt;/li&gt;&lt;li&gt;Cookie-Bench: 78.3 (#3/13)&lt;/li&gt;&lt;li&gt;OpenComputer: 58.8 (#3/8)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.5&lt;/strong&gt; — ELO 1690, #45&lt;ul&gt;&lt;li&gt;The Metanym Game: 7.0 (#1/12)&lt;/li&gt;&lt;li&gt;MineExplorer: 27.31 (#3/18)&lt;/li&gt;&lt;li&gt;Multi-domain Multi-modal Document Classificati: 61.59 (#3/15)&lt;/li&gt;&lt;li&gt;Magis-Bench: 6.46 (#3/23)&lt;/li&gt;&lt;li&gt;From Perception to Action: 15.6 (#3/16)&lt;/li&gt;&lt;li&gt;Omi SOAP Note Safety Benchmark: 4.54 (#5/6)&lt;/li&gt;&lt;li&gt;Soohak: 18.82 (#7/11)&lt;/li&gt;&lt;li&gt;CAIS Risk Index: 42.7 (#7/45)&lt;/li&gt;&lt;li&gt;VerdictBench: 59.1 (#8/17)&lt;/li&gt;&lt;li&gt;CAIS Text Capabilities Index: 36.6 (#9/40)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Pro&lt;/strong&gt; — ELO 1686, #46&lt;ul&gt;&lt;li&gt;GroupTravelBench: 10.47 (#1/9)&lt;/li&gt;&lt;li&gt;CAM-Bench: 19.67 (#1/5)&lt;/li&gt;&lt;li&gt;Beyond the All-in-One Agent: 62.0 (#1/12)&lt;/li&gt;&lt;li&gt;When Safe Skills Collide: 9.0 (#2/9)&lt;/li&gt;&lt;li&gt;HardMTBench: 90.91 (#2/20)&lt;/li&gt;&lt;li&gt;LITMUS: 69.8 (#2/6)&lt;/li&gt;&lt;li&gt;ClawProBench: 64.38 (#2/57)&lt;/li&gt;&lt;li&gt;IOI: 580.1 (#2/58)&lt;/li&gt;&lt;li&gt;Beyond Function Calling: 42.5 (#3/12)&lt;/li&gt;&lt;li&gt;ReproRepo: 19.3 (#3/4)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.5 (20251101)&lt;/strong&gt; — ELO 1686, #47&lt;ul&gt;&lt;li&gt;SciPredict: 23.05 (#2/15)&lt;/li&gt;&lt;li&gt;LongWebBench: 6.43 (#5/13)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1461.0 (#10/27)&lt;/li&gt;&lt;li&gt;Poker Agent: 1033.38 (#11/17)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1758.8 (#12/123)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1545.7 (#18/79)&lt;/li&gt;&lt;li&gt;WritingBench: 79.78 (#20/66)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1467.0 (#26/42)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 4.0 (#142/153)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Codex&lt;/strong&gt; — ELO 1686, #48&lt;ul&gt;&lt;li&gt;Hack-Verifiable TextArena: 23.3 (#3/12)&lt;/li&gt;&lt;li&gt;Mercor APEX: 20.1 (#28/53)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 88.7 (#53/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5.1&lt;/strong&gt; — ELO 1685, #49&lt;ul&gt;&lt;li&gt;TimeSage-MT: 40.5 (#1/6)&lt;/li&gt;&lt;li&gt;POLAR-Bench: 94.34 (#1/22)&lt;/li&gt;&lt;li&gt;Are Agents Ready to Teach? A Multi-Stage Bench: 63.8 (#1/11)&lt;/li&gt;&lt;li&gt;Trip+: 68.96 (#2/18)&lt;/li&gt;&lt;li&gt;Personalized Turn-Level User Conversation Sati: 4.71 (#2/7)&lt;/li&gt;&lt;li&gt;SGR-Bench: 65.64 (#2/11)&lt;/li&gt;&lt;li&gt;Hack-Verifiable TextArena: 25.9 (#2/12)&lt;/li&gt;&lt;li&gt;Greenland Sovereignty Game (implicitly as a st: 19.0 (#2/8)&lt;/li&gt;&lt;li&gt;AGORA: 50.0 (#3/8)&lt;/li&gt;&lt;li&gt;Beyond Function Calling: 42.0 (#4/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling&lt;/strong&gt; — ELO 1684, #50&lt;ul&gt;&lt;li&gt;AudioMC: 56.6 (#2/31)&lt;/li&gt;&lt;li&gt;MMAU: 77.2 (#2/31)&lt;/li&gt;&lt;li&gt;Tau3-Bench Banking_Knowledge: 25.0 (#19/28)&lt;/li&gt;&lt;li&gt;MCP Atlas: 74.1 (#24/42)&lt;/li&gt;&lt;li&gt;Vals AI Multimodal Index: 49.4 (#26/32)&lt;/li&gt;&lt;li&gt;Toolathlon: 45.5 (#35/39)&lt;/li&gt;&lt;li&gt;CharXiv-R: 78.1 (#35/60)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1418.0 (#40/42)&lt;/li&gt;&lt;li&gt;Epoch AI - Proofbench: 2.0 (#50/52)&lt;/li&gt;&lt;li&gt;Design Arena (UI Components): 1213.0 (#58/145)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 Plus&lt;/strong&gt; — ELO 1684, #51&lt;ul&gt;&lt;li&gt;StemBind: 42.2 (#1/24)&lt;/li&gt;&lt;li&gt;TOBench: 41.0 (#1/18)&lt;/li&gt;&lt;li&gt;FINESSE-Bench: 87.76 (#1/31)&lt;/li&gt;&lt;li&gt;Can Agents Price a Reaction? Evaluating LLMs o: 34.6 (#2/12)&lt;/li&gt;&lt;li&gt;CC-OCR V2: 73.03 (#2/15)&lt;/li&gt;&lt;li&gt;Disentangling Language Roles in Multilingual L: 82.0 (#3/20)&lt;/li&gt;&lt;li&gt;GroupTravelBench: 8.63 (#3/9)&lt;/li&gt;&lt;li&gt;ChartFI: 3.19 (#3/5)&lt;/li&gt;&lt;li&gt;EgoCoT-Bench: 70.68 (#3/20)&lt;/li&gt;&lt;li&gt;StereoTales: 252.0 (#3/23)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hy3&lt;/strong&gt; — ELO 1682, #52&lt;ul&gt;&lt;li&gt;Arena AI Code: 1517.0 (#17/42)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1516.66 (#17/22)&lt;/li&gt;&lt;li&gt;AA-LCR: 66.7 (#47/355)&lt;/li&gt;&lt;li&gt;CritPt: 4.9 (#47/342)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 99.0 (#91/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5-Pro&lt;/strong&gt; — ELO 1681, #53&lt;ul&gt;&lt;li&gt;PaperFit-Bench: 100.0 (#3/4)&lt;/li&gt;&lt;li&gt;AutoLab: 45.0 (#4/11)&lt;/li&gt;&lt;li&gt;PhysicianBench: 16.7 (#8/12)&lt;/li&gt;&lt;li&gt;QuestBench: 22.73 (#9/13)&lt;/li&gt;&lt;li&gt;RoadmapBench: 13.9 (#9/13)&lt;/li&gt;&lt;li&gt;ORAgentBench: 22.43 (#10/14)&lt;/li&gt;&lt;li&gt;GeneBench: 3.0 (#12/16)&lt;/li&gt;&lt;li&gt;BLXBench: 44.0 (#15/25)&lt;/li&gt;&lt;li&gt;MedScribe: 83.73 (#15/61)&lt;/li&gt;&lt;li&gt;ProofBench: 24.0 (#20/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 Plus&lt;/strong&gt; — ELO 1680, #54&lt;ul&gt;&lt;li&gt;From Knowing to Doing: 85.29 (#1/10)&lt;/li&gt;&lt;li&gt;CC-OCR V2: 75.77 (#1/15)&lt;/li&gt;&lt;li&gt;TIR-Bench: 61.6 (#1/27)&lt;/li&gt;&lt;li&gt;MMGist: 61.0 (#2/27)&lt;/li&gt;&lt;li&gt;BIM-Edit: 47.63 (#2/7)&lt;/li&gt;&lt;li&gt;WildRoadBench: 36.8 (#2/25)&lt;/li&gt;&lt;li&gt;IndustryBench: 2.07 (#2/17)&lt;/li&gt;&lt;li&gt;CUDABeaver: 23.0 (#2/6)&lt;/li&gt;&lt;li&gt;CalBench: 53.0 (#3/7)&lt;/li&gt;&lt;li&gt;ROSE: 50.3 (#4/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 397B A17B&lt;/strong&gt; — ELO 1680, #55&lt;ul&gt;&lt;li&gt;TAEF (Text Analytics Evaluation Framework): 79.5 (#1/11)&lt;/li&gt;&lt;li&gt;GeoSym-Bench: 87.47 (#1/22)&lt;/li&gt;&lt;li&gt;HarmActionsEval: 23.4 (#1/10)&lt;/li&gt;&lt;li&gt;EHR-Complex: 62.2 (#2/14)&lt;/li&gt;&lt;li&gt;ProactBench: 52.5 (#2/16)&lt;/li&gt;&lt;li&gt;EnvSimBench: 42.3 (#2/8)&lt;/li&gt;&lt;li&gt;Do Agents Know What They Can't Do? Evaluating: 58.2 (#3/9)&lt;/li&gt;&lt;li&gt;DiscoverPhysics: 33.0 (#3/11)&lt;/li&gt;&lt;li&gt;Can LLM Agents Respond to Disasters? Benchmark: 53.45 (#3/15)&lt;/li&gt;&lt;li&gt;Polaris-Bench: 72.9 (#3/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Inkling Small&lt;/strong&gt; — ELO 1680, #56&lt;ul&gt;&lt;li&gt;AudioMC: 54.9 (#3/31)&lt;/li&gt;&lt;li&gt;MMAU: 77.0 (#3/31)&lt;/li&gt;&lt;li&gt;HMMT February 2026: 90.2 (#9/25)&lt;/li&gt;&lt;li&gt;ProphetArena: 0.9417 (#9/23)&lt;/li&gt;&lt;li&gt;Vals AI CyberBench: 68.75 (#12/22)&lt;/li&gt;&lt;li&gt;MCP Atlas: 79.6 (#13/42)&lt;/li&gt;&lt;li&gt;Vals AI SWE-bench Verified: 82.2 (#13/79)&lt;/li&gt;&lt;li&gt;Vals AI TaxEval v2: 75.51 (#15/136)&lt;/li&gt;&lt;li&gt;Vals AI LiveCodeBench: 85.93 (#20/134)&lt;/li&gt;&lt;li&gt;Vals AI Harvey Legal Agent Bench: 1.67 (#20/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M3&lt;/strong&gt; — ELO 1679, #57&lt;ul&gt;&lt;li&gt;MedScribe: 87.25 (#4/61)&lt;/li&gt;&lt;li&gt;OmniDocBench 1.5: 91.6 (#8/64)&lt;/li&gt;&lt;li&gt;FutureEval: 10.85 (#11/46)&lt;/li&gt;&lt;li&gt;AA-LCR: 74.0 (#12/355)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 59.97 (#12/26)&lt;/li&gt;&lt;li&gt;Vals Index: 58.94 (#13/35)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1435.0 (#17/27)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 48.27 (#18/39)&lt;/li&gt;&lt;li&gt;MedCode: 46.29 (#19/63)&lt;/li&gt;&lt;li&gt;LMArena WebDev Arena: 1492.53 (#21/22)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.6&lt;/strong&gt; — ELO 1677, #58&lt;ul&gt;&lt;li&gt;Every Act Has Its Price: 1005.3 (#1/10)&lt;/li&gt;&lt;li&gt;CodeClinic: 53.1 (#1/8)&lt;/li&gt;&lt;li&gt;An Empirical Study of Proactive Coding Assista: 13.57 (#1/7)&lt;/li&gt;&lt;li&gt;TimeSage-MT: 40.44 (#2/6)&lt;/li&gt;&lt;li&gt;A Matter of TASTE: 72.0 (#2/6)&lt;/li&gt;&lt;li&gt;When Context Flips, Safety Breaks: 43.8 (#2/12)&lt;/li&gt;&lt;li&gt;OpenComputer: 64.4 (#2/8)&lt;/li&gt;&lt;li&gt;CAM-Bench: 19.28 (#2/5)&lt;/li&gt;&lt;li&gt;TraceEval: 64.5 (#2/10)&lt;/li&gt;&lt;li&gt;LibEvoBench: 81.0 (#3/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.3&lt;/strong&gt; — ELO 1677, #59&lt;ul&gt;&lt;li&gt;HarmActionsEval: 12.77 (#2/10)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1716.2 (#17/123)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1393.0 (#33/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 (2025-08-07)&lt;/strong&gt; — ELO 1677, #60&lt;ul&gt;&lt;li&gt;HELM MedQA: 96.8191 (#1/13)&lt;/li&gt;&lt;li&gt;Poker Agent: 1103.17 (#2/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Codex&lt;/strong&gt; — ELO 1676, #61&lt;ul&gt;&lt;li&gt;MonitoringBench: 71.1 (#3/13)&lt;/li&gt;&lt;li&gt;Visual Aesthetic Benchmark (VAB): 50.2 (#12/23)&lt;/li&gt;&lt;li&gt;Mercor APEX: 20.7 (#27/53)&lt;/li&gt;&lt;li&gt;LiveBench: 69.31 (#36/43)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3&lt;/strong&gt; — ELO 1675, #62&lt;ul&gt;&lt;li&gt;DRInQ: 67.0 (#2/13)&lt;/li&gt;&lt;li&gt;Forge: 91.5 (#2/21)&lt;/li&gt;&lt;li&gt;CommonWhy: 17.2 (#3/7)&lt;/li&gt;&lt;li&gt;EnactToM: 13.6 (#4/7)&lt;/li&gt;&lt;li&gt;TRLawBench: 81.3 (#4/32)&lt;/li&gt;&lt;li&gt;IneqMath: 37.0 (#5/42)&lt;/li&gt;&lt;li&gt;From Perception to Action: 10.1 (#8/16)&lt;/li&gt;&lt;li&gt;VitaBench 2.0: 40.3 (#14/35)&lt;/li&gt;&lt;li&gt;CharXiv-R: 78.6 (#33/60)&lt;/li&gt;&lt;li&gt;ZeroBench: 6.0 (#35/69)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5-Turbo&lt;/strong&gt; — ELO 1674, #63&lt;ul&gt;&lt;li&gt;ClawProBench: 61.92 (#8/57)&lt;/li&gt;&lt;li&gt;ALE-Bench: 633.98 (#47/79)&lt;/li&gt;&lt;li&gt;AA-LCR: 60.7 (#95/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.3 (#124/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Mini&lt;/strong&gt; — ELO 1671, #64&lt;ul&gt;&lt;li&gt;LLM-as-a-Reviewer: 99.7 (#1/12)&lt;/li&gt;&lt;li&gt;TempGlitch: 52.4 (#1/10)&lt;/li&gt;&lt;li&gt;NRT-Bench: 11.4 (#2/4)&lt;/li&gt;&lt;li&gt;Causal Sensitivity Score (CSS): 43.9 (#2/6)&lt;/li&gt;&lt;li&gt;Chartographer: 94.0 (#2/15)&lt;/li&gt;&lt;li&gt;TriBench-Ko: 78.1 (#2/13)&lt;/li&gt;&lt;li&gt;BehaviorBench: 29.0 (#3/20)&lt;/li&gt;&lt;li&gt;Managing Procedural Memory in LLM Agents: 2.0 (#3/13)&lt;/li&gt;&lt;li&gt;MedCTA: 28.31 (#3/18)&lt;/li&gt;&lt;li&gt;Momento: 75.15 (#3/5)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.3&lt;/strong&gt; — ELO 1670, #65&lt;ul&gt;&lt;li&gt;CaseLaw v2: 79.31 (#1/54)&lt;/li&gt;&lt;li&gt;AgentCIBench: 91.5 (#4/15)&lt;/li&gt;&lt;li&gt;EnterpriseArena: 40.0 (#4/27)&lt;/li&gt;&lt;li&gt;OmniMatBench: 29.1 (#5/13)&lt;/li&gt;&lt;li&gt;TukaBench: 11.6 (#8/13)&lt;/li&gt;&lt;li&gt;SearchGEO: 7.6 (#9/13)&lt;/li&gt;&lt;li&gt;CommunityFact: 53.85 (#13/15)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 125.0 (#15/138)&lt;/li&gt;&lt;li&gt;scBench: 44.27 (#15/19)&lt;/li&gt;&lt;li&gt;ResearchClawBench: 12.4 (#20/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro&lt;/strong&gt; — ELO 1668, #67&lt;ul&gt;&lt;li&gt;From Hallucination to Grounding: 57.28 (#1/13)&lt;/li&gt;&lt;li&gt;Active Evidence-Seeking and Diagnostic Reasoni: 49.4 (#1/15)&lt;/li&gt;&lt;li&gt;Xent Games: 65.86 (#1/12)&lt;/li&gt;&lt;li&gt;TRAP: 36.9 (#2/22)&lt;/li&gt;&lt;li&gt;ERGeoBench: 6.4 (#2/9)&lt;/li&gt;&lt;li&gt;K-FinHallu: 85.9 (#2/12)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 75.9 (#2/44)&lt;/li&gt;&lt;li&gt;QUIET: 8.44 (#2/12)&lt;/li&gt;&lt;li&gt;Emotional intelligence in large language model: 64.1 (#2/7)&lt;/li&gt;&lt;li&gt;TRACER: 81.0 (#2/4)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4.5&lt;/strong&gt; — ELO 1668, #68&lt;ul&gt;&lt;li&gt;TW-LegalBench: 81.0 (#1/13)&lt;/li&gt;&lt;li&gt;VeriTrip: 69.23 (#1/11)&lt;/li&gt;&lt;li&gt;AssertLLM2: 28.32 (#1/6)&lt;/li&gt;&lt;li&gt;PreScam: 79.36 (#1/5)&lt;/li&gt;&lt;li&gt;LegalCiteBench: 77.8 (#1/21)&lt;/li&gt;&lt;li&gt;MAVEN-Bench: 70.0 (#2/8)&lt;/li&gt;&lt;li&gt;StressEval: 37.4 (#2/10)&lt;/li&gt;&lt;li&gt;ThaiSafetyBench: 9.75 (#2/24)&lt;/li&gt;&lt;li&gt;DRInQ: 65.0 (#3/13)&lt;/li&gt;&lt;li&gt;HIDBench: 56.1 (#3/9)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1&lt;/strong&gt; — ELO 1668, #69&lt;ul&gt;&lt;li&gt;FactoryBench: 20.6 (#1/4)&lt;/li&gt;&lt;li&gt;CombEval: 74.1 (#3/11)&lt;/li&gt;&lt;li&gt;ATC Safety-Oriented Language Understanding Eval: 67.75 (#3/11)&lt;/li&gt;&lt;li&gt;Poker Agent: 1038.59 (#9/17)&lt;/li&gt;&lt;li&gt;OR-Space: 53.0 (#10/18)&lt;/li&gt;&lt;li&gt;Mirror, Mirror on the Wall: 52.0 (#13/43)&lt;/li&gt;&lt;li&gt;scBench: 38.8 (#16/19)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1551.0 (#17/79)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 120.0 (#24/138)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1401.0 (#27/27)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.5 Flash Lite&lt;/strong&gt; — ELO 1668, #70&lt;ul&gt;&lt;li&gt;Sycophancy (Lechmazur): 990990.0 (#15/24)&lt;/li&gt;&lt;li&gt;Roboflow Playground Object Detection: 1198.0 (#22/42)&lt;/li&gt;&lt;li&gt;ParseBench: 57.15 (#29/55)&lt;/li&gt;&lt;li&gt;Roboflow Playground Overall: 1198.0 (#35/66)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 40.86 (#79/128)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 76.9 (#115/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 (2025-04-16)&lt;/strong&gt; — ELO 1665, #71&lt;ul&gt;&lt;li&gt;HELM Safety: 98.1606 (#1/57)&lt;/li&gt;&lt;li&gt;VTB: 13.74 (#6/17)&lt;/li&gt;&lt;li&gt;WritingBench: 80.46 (#17/66)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1625.36 (#30/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2.5&lt;/strong&gt; — ELO 1664, #72&lt;ul&gt;&lt;li&gt;EHR-Complex: 62.3 (#1/14)&lt;/li&gt;&lt;li&gt;PinTrace: 45.78 (#1/10)&lt;/li&gt;&lt;li&gt;TuRTLe Module Completion (NotSoTiny): 31.57 (#1/15)&lt;/li&gt;&lt;li&gt;MMVU: 80.4 (#1/40)&lt;/li&gt;&lt;li&gt;FINAL Bench Metacognitive: 78.54 (#1/9)&lt;/li&gt;&lt;li&gt;UXBench: 20.5 (#2/8)&lt;/li&gt;&lt;li&gt;Dr. DocBench: 60.38 (#2/12)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Icarus Verilog): 83.38 (#2/44)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Verilator): 81.65 (#2/44)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Icarus Verilog): 81.47 (#2/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.20&lt;/strong&gt; — ELO 1664, #73&lt;ul&gt;&lt;li&gt;MathConstraint: 58.1 (#2/12)&lt;/li&gt;&lt;li&gt;ConsumerSimBench: 44.9 (#3/13)&lt;/li&gt;&lt;li&gt;FrontierOR: 22.0 (#5/7)&lt;/li&gt;&lt;li&gt;MedBench v5: 94.6 (#6/10)&lt;/li&gt;&lt;li&gt;The Wrong Kind of Right: 25.3 (#7/26)&lt;/li&gt;&lt;li&gt;XL-SafetyBench: 30.6 (#7/10)&lt;/li&gt;&lt;li&gt;AutoLab: 35.0 (#8/11)&lt;/li&gt;&lt;li&gt;CAIS Risk Index: 44.5 (#8/45)&lt;/li&gt;&lt;li&gt;When Context Flips, Safety Breaks: 18.2 (#10/12)&lt;/li&gt;&lt;li&gt;PhysicianBench: 5.3 (#12/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5&lt;/strong&gt; — ELO 1662, #75&lt;ul&gt;&lt;li&gt;Are LLMs Ready to Assist Physicians? PhysAssis: 69.4 (#1/14)&lt;/li&gt;&lt;li&gt;Ego2World: 183.0 (#1/6)&lt;/li&gt;&lt;li&gt;From 0-Order Selection to 2-Order Judgment: 38.33 (#2/13)&lt;/li&gt;&lt;li&gt;ActTraitBench: 1.79 (#3/15)&lt;/li&gt;&lt;li&gt;Metacognitive Probe: 74.25 (#3/8)&lt;/li&gt;&lt;li&gt;FINESSE-Bench: 87.27 (#4/31)&lt;/li&gt;&lt;li&gt;An Empirical Study of Proactive Coding Assista: 7.77 (#4/7)&lt;/li&gt;&lt;li&gt;Claw-Eval-Live: 61.9 (#4/13)&lt;/li&gt;&lt;li&gt;FINAL Bench Metacognitive: 76.38 (#4/9)&lt;/li&gt;&lt;li&gt;JamSet/JamBench: 37.0 (#5/9)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro (Preview 03-25)&lt;/strong&gt; — ELO 1661, #77&lt;ul&gt;&lt;li&gt;CodeGolf Bench: 73.9 (#1/9)&lt;/li&gt;&lt;li&gt;OJBench: 38.91 (#5/44)&lt;/li&gt;&lt;li&gt;Defects4J: 41.4 (#9/33)&lt;/li&gt;&lt;li&gt;BigCodeBench-Hard: 29.7 (#12/20)&lt;/li&gt;&lt;li&gt;HELM Safety: 91.3978 (#26/57)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1393.2 (#32/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1395.3 (#55/123)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1517.98 (#61/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Pro&lt;/strong&gt; — ELO 1661, #78&lt;ul&gt;&lt;li&gt;AttuneBench: 53.61 (#4/11)&lt;/li&gt;&lt;li&gt;Cookie-Bench: 76.3 (#5/13)&lt;/li&gt;&lt;li&gt;Claw-Eval-Live: 53.3 (#6/13)&lt;/li&gt;&lt;li&gt;DeepSearchQA: 86.7 (#10/15)&lt;/li&gt;&lt;li&gt;WildClawBench: 40.2 (#11/20)&lt;/li&gt;&lt;li&gt;GeneBench: 1.6 (#16/16)&lt;/li&gt;&lt;li&gt;ALE-Bench: 785.17 (#36/79)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1433.0 (#37/42)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 105.0 (#71/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2 Speciale&lt;/strong&gt; — ELO 1659, #79&lt;ul&gt;&lt;li&gt;HMMT 2025: 97.5 (#6/89)&lt;/li&gt;&lt;li&gt;MathArena Apex: 9.38 (#26/51)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1238.1 (#73/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5V Turbo&lt;/strong&gt; — ELO 1659, #80&lt;ul&gt;&lt;li&gt;SpatialAct: 3.5 (#3/7)&lt;/li&gt;&lt;li&gt;ROSE: 33.8 (#5/10)&lt;/li&gt;&lt;li&gt;MineExplorer: 19.93 (#5/18)&lt;/li&gt;&lt;li&gt;CiteVQA: 14.9 (#7/20)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1417.0 (#23/27)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1400.0 (#42/42)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash Lite&lt;/strong&gt; — ELO 1658, #81&lt;ul&gt;&lt;li&gt;LaViSA: 84.0 (#2/10)&lt;/li&gt;&lt;li&gt;ChildAgentEval: 48.0 (#3/6)&lt;/li&gt;&lt;li&gt;IntentGrasp: 50.99 (#4/20)&lt;/li&gt;&lt;li&gt;STALE: 22.4 (#4/15)&lt;/li&gt;&lt;li&gt;TAEF (Text Analytics Evaluation Framework): 70.3 (#5/11)&lt;/li&gt;&lt;li&gt;LLM-as-a-Reviewer: 48.3 (#6/12)&lt;/li&gt;&lt;li&gt;SpaceDG: 48.8 (#6/29)&lt;/li&gt;&lt;li&gt;AGORA: 6.35 (#7/8)&lt;/li&gt;&lt;li&gt;MolDeTox: 0.43 (#8/15)&lt;/li&gt;&lt;li&gt;Are Agents Ready to Teach? A Multi-Stage Bench: 46.3 (#9/11)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V4 Flash&lt;/strong&gt; — ELO 1658, #82&lt;ul&gt;&lt;li&gt;PlanBench-XL: 63.08 (#2/10)&lt;/li&gt;&lt;li&gt;FullHome: 63.0 (#2/8)&lt;/li&gt;&lt;li&gt;Beyond the All-in-One Agent: 57.33 (#2/12)&lt;/li&gt;&lt;li&gt;SmartHome-Bench: 85.16 (#3/14)&lt;/li&gt;&lt;li&gt;When Safe Skills Collide: 9.0 (#3/9)&lt;/li&gt;&lt;li&gt;Can Large Language Models Handle Discourse Par: 69.8 (#3/10)&lt;/li&gt;&lt;li&gt;Do LLMs Build World Models From Text? A Multil: 26.4 (#3/14)&lt;/li&gt;&lt;li&gt;SearchGEO: 20.1 (#4/13)&lt;/li&gt;&lt;li&gt;AGORA: 40.06 (#5/8)&lt;/li&gt;&lt;li&gt;HOLMES: 50.98 (#5/11)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.1&lt;/strong&gt; — ELO 1658, #83&lt;ul&gt;&lt;li&gt;The Metanym Game: 6.05 (#4/12)&lt;/li&gt;&lt;li&gt;MCP-Universe: 29.44 (#4/27)&lt;/li&gt;&lt;li&gt;ZeroBench: 5.0 (#40/69)&lt;/li&gt;&lt;li&gt;ALE-Bench: 674.77 (#42/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Mini (2025-08-07)&lt;/strong&gt; — ELO 1657, #84&lt;ul&gt;&lt;li&gt;HELM MedQA: 95.6262 (#2/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4.1 (20250805)&lt;/strong&gt; — ELO 1657, #85&lt;ul&gt;&lt;li&gt;SciPredict: 22.22 (#4/15)&lt;/li&gt;&lt;li&gt;Seneca-TRBench: 90.06 (#4/5)&lt;/li&gt;&lt;li&gt;Xent Games: 58.65 (#6/12)&lt;/li&gt;&lt;li&gt;WritingBench: 76.36 (#29/66)&lt;/li&gt;&lt;li&gt;IOI: 12.52 (#33/58)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3 Ultra 550B A55B&lt;/strong&gt; — ELO 1657, #86&lt;ul&gt;&lt;li&gt;Vals Index: 43.99 (#27/35)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 37.67 (#31/39)&lt;/li&gt;&lt;li&gt;MedCode: 38.62 (#36/63)&lt;/li&gt;&lt;li&gt;ProofBench: 2.0 (#47/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Step 3.7 Flash&lt;/strong&gt; — ELO 1656, #87&lt;ul&gt;&lt;li&gt;ArxivMath: 46.67 (#17/20)&lt;/li&gt;&lt;li&gt;AA-LCR: 63.7 (#77/355)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 104.0 (#79/138)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 40.05 (#85/128)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 27B&lt;/strong&gt; — ELO 1655, #88&lt;ul&gt;&lt;li&gt;CheXpercept: 92.2 (#1/14)&lt;/li&gt;&lt;li&gt;The Age of Curiosity Meets the Age of AI: Benc: 4.98 (#1/13)&lt;/li&gt;&lt;li&gt;RefSpatialBench: 70.0 (#1/7)&lt;/li&gt;&lt;li&gt;Momento: 75.15 (#2/5)&lt;/li&gt;&lt;li&gt;Done, But Not Sure: 37.8 (#2/20)&lt;/li&gt;&lt;li&gt;RxEval: 71.7 (#4/17)&lt;/li&gt;&lt;li&gt;CUDABeaver: 19.2 (#4/6)&lt;/li&gt;&lt;li&gt;Trip+: 66.35 (#5/18)&lt;/li&gt;&lt;li&gt;PerfCodeBench: 65.07 (#5/20)&lt;/li&gt;&lt;li&gt;VideoMME w sub.: 87.7 (#5/65)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen3-8B-Base&lt;/strong&gt; — ELO 1653, #89&lt;ul&gt;&lt;li&gt;IndoBias: 67.3 (#11/26)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 31B (IT)&lt;/strong&gt; — ELO 1651, #90&lt;ul&gt;&lt;li&gt;Momento: 78.26 (#1/5)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Icarus Verilog): 81.51 (#1/44)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Verilator): 79.83 (#1/44)&lt;/li&gt;&lt;li&gt;TuRTLe Module Completion (NotSoTiny): 29.54 (#2/15)&lt;/li&gt;&lt;li&gt;K12-Bench: 46.4 (#3/11)&lt;/li&gt;&lt;li&gt;CUDABeaver: 21.6 (#3/6)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Icarus Verilog): 82.57 (#3/44)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Verilator): 80.51 (#3/44)&lt;/li&gt;&lt;li&gt;TableVista: 54.3 (#4/29)&lt;/li&gt;&lt;li&gt;GENSTRAT: 25.0 (#5/9)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 122B A10B&lt;/strong&gt; — ELO 1650, #91&lt;ul&gt;&lt;li&gt;ZEROBench-Sub: 36.2 (#1/45)&lt;/li&gt;&lt;li&gt;VideoMME w/o sub.: 83.9 (#1/61)&lt;/li&gt;&lt;li&gt;CheXpercept: 91.3 (#3/14)&lt;/li&gt;&lt;li&gt;SceneFunRI: 12.63 (#3/17)&lt;/li&gt;&lt;li&gt;RefSpatialBench: 69.3 (#3/7)&lt;/li&gt;&lt;li&gt;MMVU: 74.7 (#3/40)&lt;/li&gt;&lt;li&gt;FullStackBench en: 62.6 (#3/31)&lt;/li&gt;&lt;li&gt;TimeSage-MT: 37.34 (#4/6)&lt;/li&gt;&lt;li&gt;TAEF (Text Analytics Evaluation Framework): 72.2 (#4/11)&lt;/li&gt;&lt;li&gt;TIR-Bench: 53.2 (#4/27)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Mini&lt;/strong&gt; — ELO 1649, #92&lt;ul&gt;&lt;li&gt;CulturaQA: 75.09 (#1/9)&lt;/li&gt;&lt;li&gt;From Hallucination to Grounding: 56.75 (#2/13)&lt;/li&gt;&lt;li&gt;On the Cultural Anachronism and Temporal Reaso: 51.2 (#2/11)&lt;/li&gt;&lt;li&gt;BLUEX v2: 8.9 (#3/10)&lt;/li&gt;&lt;li&gt;Scammer4U: 61.0 (#3/4)&lt;/li&gt;&lt;li&gt;Seeing Isn't Knowing: 49.9 (#3/9)&lt;/li&gt;&lt;li&gt;VeriTrip: 67.26 (#3/11)&lt;/li&gt;&lt;li&gt;JMed48k: 87.1 (#3/21)&lt;/li&gt;&lt;li&gt;Time to REFLECT: 43.5 (#3/14)&lt;/li&gt;&lt;li&gt;A2RBench: 36.9 (#3/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4&lt;/strong&gt; — ELO 1649, #93&lt;ul&gt;&lt;li&gt;ComplexMCP: 41.84 (#5/17)&lt;/li&gt;&lt;li&gt;MGSM: 93.78 (#6/67)&lt;/li&gt;&lt;li&gt;MATH 500: 90.4 (#23/58)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1609.7 (#28/123)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1399.8 (#31/79)&lt;/li&gt;&lt;li&gt;ZeroBench: 4.0 (#43/69)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro (Preview 05-06)&lt;/strong&gt; — ELO 1649, #94&lt;ul&gt;&lt;li&gt;HELM MedQA: 93.4394 (#4/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash (Preview 09-2025)&lt;/strong&gt; — ELO 1649, #95&lt;ul&gt;&lt;li&gt;MedCode: 40.54 (#30/63)&lt;/li&gt;&lt;li&gt;MGSM: 89.85 (#40/67)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hy3-preview&lt;/strong&gt; — ELO 1647, #96&lt;ul&gt;&lt;li&gt;PlanningBench: 36.17 (#5/16)&lt;/li&gt;&lt;li&gt;AgentTrap: 48.0 (#7/8)&lt;/li&gt;&lt;li&gt;Trip+: 61.3 (#13/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash (Preview 05-20)&lt;/strong&gt; — ELO 1647, #97&lt;ul&gt;&lt;li&gt;Visual-Language Understanding: 49.15 (#12/54)&lt;/li&gt;&lt;li&gt;EnigmaEval: 2.7 (#26/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash Lite (Preview)&lt;/strong&gt; — ELO 1645, #98&lt;ul&gt;&lt;li&gt;GENSTRAT: -27.0 (#7/9)&lt;/li&gt;&lt;li&gt;Beyond the All-in-One Agent: 16.67 (#10/12)&lt;/li&gt;&lt;li&gt;TutorBench: 51.5 (#14/23)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 46.93 (#19/54)&lt;/li&gt;&lt;li&gt;MultiNRC: 25.02 (#24/39)&lt;/li&gt;&lt;li&gt;EnigmaEval: 3.04 (#25/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.7&lt;/strong&gt; — ELO 1645, #99&lt;ul&gt;&lt;li&gt;StreamProfileBench: 44.21 (#3/14)&lt;/li&gt;&lt;li&gt;ComplexMCP: 42.55 (#4/17)&lt;/li&gt;&lt;li&gt;FINESSE-Bench: 86.39 (#5/31)&lt;/li&gt;&lt;li&gt;ADBench: 81.0 (#5/10)&lt;/li&gt;&lt;li&gt;PrepBench: 41.5 (#6/10)&lt;/li&gt;&lt;li&gt;CUDABeaver: 12.7 (#6/6)&lt;/li&gt;&lt;li&gt;From 0-Order Selection to 2-Order Judgment: 30.0 (#6/13)&lt;/li&gt;&lt;li&gt;PaliBench: 92.0 (#7/10)&lt;/li&gt;&lt;li&gt;IMO-AnswerBench: 82.0 (#12/22)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 63.4 (#25/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Max&lt;/strong&gt; — ELO 1645, #100&lt;ul&gt;&lt;li&gt;Disentangling Language Roles in Multilingual L: 84.0 (#1/20)&lt;/li&gt;&lt;li&gt;Every Act Has Its Price: 1004.4 (#2/10)&lt;/li&gt;&lt;li&gt;BacktestBench: 61.84 (#2/23)&lt;/li&gt;&lt;li&gt;CPCD-Bench: 4.23 (#4/14)&lt;/li&gt;&lt;li&gt;ATC Safety-Oriented Language Understanding Eval: 52.34 (#4/11)&lt;/li&gt;&lt;li&gt;Exploring Autonomous Agentic Data Engineering: 1.58 (#6/6)&lt;/li&gt;&lt;li&gt;DisasterBench: 63.95 (#6/12)&lt;/li&gt;&lt;li&gt;IDE-Bench: 65.0 (#6/15)&lt;/li&gt;&lt;li&gt;ComplexMCP: 31.2 (#8/17)&lt;/li&gt;&lt;li&gt;IndustryBench: 1.97 (#8/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3 Ultra&lt;/strong&gt; — ELO 1645, #101&lt;ul&gt;&lt;li&gt;IMO-AnswerBench: 92.3 (#1/22)&lt;/li&gt;&lt;li&gt;IOI: 570.0 (#3/58)&lt;/li&gt;&lt;li&gt;GDPval: 46.7 (#13/18)&lt;/li&gt;&lt;li&gt;FutureEval: 6.56 (#30/46)&lt;/li&gt;&lt;li&gt;Toolathlon: 34.3 (#38/39)&lt;/li&gt;&lt;li&gt;MCP Atlas: 44.7 (#40/42)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 104.0 (#76/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4&lt;/strong&gt; — ELO 1644, #102&lt;ul&gt;&lt;li&gt;MCP-Universe: 33.33 (#2/27)&lt;/li&gt;&lt;li&gt;MATH 500: 96.2 (#2/58)&lt;/li&gt;&lt;li&gt;Xent Games: 63.22 (#2/12)&lt;/li&gt;&lt;li&gt;USAMO25: 37.5 (#3/13)&lt;/li&gt;&lt;li&gt;MAVEN-Bench: 55.0 (#4/8)&lt;/li&gt;&lt;li&gt;GlobalDentBench: 57.77 (#5/12)&lt;/li&gt;&lt;li&gt;Every Act Has Its Price: 993.3 (#6/10)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 65.81 (#9/54)&lt;/li&gt;&lt;li&gt;VerdictBench: 54.36 (#10/17)&lt;/li&gt;&lt;li&gt;TIR-Bench: 22.5 (#10/27)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2&lt;/strong&gt; — ELO 1643, #103&lt;ul&gt;&lt;li&gt;SuiChat-CN: 76.3 (#1/44)&lt;/li&gt;&lt;li&gt;MLB: 77.29 (#1/10)&lt;/li&gt;&lt;li&gt;AutoLogi: 89.5 (#1/10)&lt;/li&gt;&lt;li&gt;MAVEN-Bench: 57.0 (#3/8)&lt;/li&gt;&lt;li&gt;RealityTest: 55.2 (#4/17)&lt;/li&gt;&lt;li&gt;Emotional intelligence in large language model: 60.6 (#5/7)&lt;/li&gt;&lt;li&gt;ADBench: 79.0 (#7/10)&lt;/li&gt;&lt;li&gt;AsyncTool: 24.44 (#8/19)&lt;/li&gt;&lt;li&gt;Rogo Big Finance Bench: 45.0 (#8/14)&lt;/li&gt;&lt;li&gt;ROK-FORTRESS: 7.3 (#9/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2.5&lt;/strong&gt; — ELO 1642, #104&lt;ul&gt;&lt;li&gt;Omni-DeepSearch: 11.72 (#5/12)&lt;/li&gt;&lt;li&gt;Vals Multimodal Index: 52.77 (#17/26)&lt;/li&gt;&lt;li&gt;BLXBench: 15.7 (#19/25)&lt;/li&gt;&lt;li&gt;Vals Index: 51.57 (#21/35)&lt;/li&gt;&lt;li&gt;CharXiv-R: 81.0 (#27/60)&lt;/li&gt;&lt;li&gt;ProofBench: 16.0 (#29/49)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 36.73 (#32/39)&lt;/li&gt;&lt;li&gt;Arena AI Code: 1435.0 (#34/42)&lt;/li&gt;&lt;li&gt;MedScribe: 72.15 (#50/61)&lt;/li&gt;&lt;li&gt;MedCode: 31.89 (#54/63)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4&lt;/strong&gt; — ELO 1641, #105&lt;ul&gt;&lt;li&gt;PrivacyPeek: 86.46 (#1/10)&lt;/li&gt;&lt;li&gt;Exploring Autonomous Agentic Data Engineering: 3.0 (#2/6)&lt;/li&gt;&lt;li&gt;HIDBench: 56.6 (#2/9)&lt;/li&gt;&lt;li&gt;When the Manual Lies: 100.0 (#3/8)&lt;/li&gt;&lt;li&gt;MLB: 74.53 (#3/10)&lt;/li&gt;&lt;li&gt;MCP-Universe: 29.44 (#5/27)&lt;/li&gt;&lt;li&gt;AfroBench-Lite: 68.69 (#5/24)&lt;/li&gt;&lt;li&gt;The Metanym Game: 5.3 (#6/12)&lt;/li&gt;&lt;li&gt;ComplexMCP: 38.29 (#7/17)&lt;/li&gt;&lt;li&gt;TRLawBench: 75.6 (#9/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Max (Preview)&lt;/strong&gt; — ELO 1641, #107&lt;ul&gt;&lt;li&gt;Poker Agent: 994.51 (#15/17)&lt;/li&gt;&lt;li&gt;MGSM: 92.15 (#19/67)&lt;/li&gt;&lt;li&gt;CritPt: 0.9 (#99/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 39.7 (#162/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 27B&lt;/strong&gt; — ELO 1640, #108&lt;ul&gt;&lt;li&gt;TIR-Bench: 59.8 (#2/27)&lt;/li&gt;&lt;li&gt;ZEROBench-Sub: 36.2 (#2/45)&lt;/li&gt;&lt;li&gt;VideoMME w/o sub.: 82.8 (#2/61)&lt;/li&gt;&lt;li&gt;OJBench: 40.1 (#3/44)&lt;/li&gt;&lt;li&gt;IFMTBench: 81.06 (#4/15)&lt;/li&gt;&lt;li&gt;OpenComputer: 32.3 (#4/8)&lt;/li&gt;&lt;li&gt;MMVU: 73.3 (#4/40)&lt;/li&gt;&lt;li&gt;PrivacySIM: 36.41 (#6/6)&lt;/li&gt;&lt;li&gt;TeleResilienceBench: 17.6 (#6/8)&lt;/li&gt;&lt;li&gt;FullStackBench en: 60.1 (#6/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 (2024-12-17)&lt;/strong&gt; — ELO 1640, #110&lt;ul&gt;&lt;li&gt;BigCodeBench-Hard: 32.4 (#2/20)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1768.81 (#4/108)&lt;/li&gt;&lt;li&gt;HELM Safety: 97.58 (#4/57)&lt;/li&gt;&lt;li&gt;EnigmaEval: 5.65 (#17/39)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 45.25 (#26/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 4 (20250514)&lt;/strong&gt; — ELO 1639, #111&lt;ul&gt;&lt;li&gt;Xent Games: 58.35 (#7/12)&lt;/li&gt;&lt;li&gt;WritingBench: 74.45 (#33/66)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Chat&lt;/strong&gt; — ELO 1639, #112&lt;ul&gt;&lt;li&gt;OdysseyBench: 40.33 (#3/10)&lt;/li&gt;&lt;li&gt;PreScam: 71.84 (#4/5)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1488.2 (#26/79)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 82.04 (#75/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LongCat 2.0&lt;/strong&gt; — ELO 1639, #113&lt;ul&gt;&lt;li&gt;CritPt: 2.6 (#67/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 58.0 (#109/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2&lt;/strong&gt; — ELO 1638, #114&lt;ul&gt;&lt;li&gt;LITMUS: 71.51 (#1/6)&lt;/li&gt;&lt;li&gt;RepoMirage: 39.8 (#2/8)&lt;/li&gt;&lt;li&gt;StreamProfileBench: 44.63 (#2/14)&lt;/li&gt;&lt;li&gt;PreScam: 75.8 (#2/5)&lt;/li&gt;&lt;li&gt;Correction Suppression Benchmark: 84.0 (#2/8)&lt;/li&gt;&lt;li&gt;GR-Ben: 55.4 (#2/22)&lt;/li&gt;&lt;li&gt;LiveFMBench: 43.55 (#2/11)&lt;/li&gt;&lt;li&gt;ABC-Bench: 50.1 (#2/11)&lt;/li&gt;&lt;li&gt;PersonaArena: 3.9 (#3/18)&lt;/li&gt;&lt;li&gt;TraceEval: 62.1 (#3/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.7 Sonnet (20250219)&lt;/strong&gt; — ELO 1638, #115&lt;ul&gt;&lt;li&gt;BigCodeBench-Hard: 32.4 (#3/20)&lt;/li&gt;&lt;li&gt;Defects4J: 47.8 (#3/33)&lt;/li&gt;&lt;li&gt;MedHELM: 63.5714 (#3/9)&lt;/li&gt;&lt;li&gt;MedGUIDE: 55.6 (#6/25)&lt;/li&gt;&lt;li&gt;HELM MedQA: 85.6859 (#8/13)&lt;/li&gt;&lt;li&gt;OPT-BENCH: 53.0 (#11/19)&lt;/li&gt;&lt;li&gt;HELM Safety: 94.4914 (#16/57)&lt;/li&gt;&lt;li&gt;MGSM: 92.4 (#17/67)&lt;/li&gt;&lt;li&gt;EnigmaEval: 2.26 (#27/39)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 43.02 (#30/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Step 3.5 Flash&lt;/strong&gt; — ELO 1638, #116&lt;ul&gt;&lt;li&gt;From Knowing to Doing: 21.86 (#6/10)&lt;/li&gt;&lt;li&gt;IMO-AnswerBench: 85.4 (#8/22)&lt;/li&gt;&lt;li&gt;Can LLM Agents Respond to Disasters? Benchmark: 46.68 (#11/15)&lt;/li&gt;&lt;li&gt;HMMT February 2026: 86.36 (#14/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O4 Mini (2025-04-16)&lt;/strong&gt; — ELO 1636, #117&lt;ul&gt;&lt;li&gt;HELM MedQA: 94.831 (#3/13)&lt;/li&gt;&lt;li&gt;HELM Safety: 97.3247 (#5/57)&lt;/li&gt;&lt;li&gt;VTB: 11.12 (#8/17)&lt;/li&gt;&lt;li&gt;WritingBench: 72.9 (#38/66)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1538.33 (#55/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;qwen3.5-flash&lt;/strong&gt; — ELO 1635, #118&lt;ul&gt;&lt;li&gt;StereoTales: 157.0 (#15/23)&lt;/li&gt;&lt;li&gt;ALE-Bench: 265.93 (#71/79)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 143.94 (#234/463)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.1 Fast&lt;/strong&gt; — ELO 1634, #119&lt;ul&gt;&lt;li&gt;Hack-Verifiable TextArena: 28.5 (#1/12)&lt;/li&gt;&lt;li&gt;TAEF (Text Analytics Evaluation Framework): 77.3 (#3/11)&lt;/li&gt;&lt;li&gt;Soohak: 30.88 (#3/11)&lt;/li&gt;&lt;li&gt;Can LLM Agents Respond to Disasters? Benchmark: 52.1 (#5/15)&lt;/li&gt;&lt;li&gt;QUIET: 8.11 (#6/12)&lt;/li&gt;&lt;li&gt;Checkup2Action: 40.8 (#6/8)&lt;/li&gt;&lt;li&gt;DentalGPT Dental Eval Suite: 56.7 (#6/16)&lt;/li&gt;&lt;li&gt;SpaceDG: 35.6 (#23/29)&lt;/li&gt;&lt;li&gt;APEX-Agents: 24.8 (#31/44)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1184.6 (#44/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.6&lt;/strong&gt; — ELO 1634, #120&lt;ul&gt;&lt;li&gt;A2RBench: 21.0 (#8/14)&lt;/li&gt;&lt;li&gt;MCP-Universe: 25.97 (#11/27)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 69.1 (#17/44)&lt;/li&gt;&lt;li&gt;PLawBench: 60.49 (#17/29)&lt;/li&gt;&lt;li&gt;ClawProBench: 56.29 (#32/57)&lt;/li&gt;&lt;li&gt;Mercor APEX: 4.0 (#49/53)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1398.7 (#54/123)&lt;/li&gt;&lt;li&gt;ALE-Bench: 340.82 (#67/79)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 1.14 (#85/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.5&lt;/strong&gt; — ELO 1634, #121&lt;ul&gt;&lt;li&gt;ActTraitBench: 2.17 (#1/15)&lt;/li&gt;&lt;li&gt;PinTrace: 45.42 (#2/10)&lt;/li&gt;&lt;li&gt;HOLMES: 54.77 (#3/11)&lt;/li&gt;&lt;li&gt;Every Act Has Its Price: 994.7 (#4/10)&lt;/li&gt;&lt;li&gt;GDPval-MM: 59.0 (#5/14)&lt;/li&gt;&lt;li&gt;ContractBench: 62.6 (#7/20)&lt;/li&gt;&lt;li&gt;An Empirical Study of Proactive Coding Assista: 2.77 (#7/7)&lt;/li&gt;&lt;li&gt;StreamProfileBench: 37.9 (#8/14)&lt;/li&gt;&lt;li&gt;ConsumerSimBench: 35.2 (#9/13)&lt;/li&gt;&lt;li&gt;MUSE: 5.35 (#11/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 35B A3B&lt;/strong&gt; — ELO 1634, #122&lt;ul&gt;&lt;li&gt;HardMTBench: 90.68 (#3/20)&lt;/li&gt;&lt;li&gt;ZEROBench-Sub: 34.4 (#3/45)&lt;/li&gt;&lt;li&gt;MMGist: 55.2 (#4/27)&lt;/li&gt;&lt;li&gt;SpatialAct: 1.6 (#4/7)&lt;/li&gt;&lt;li&gt;VideoMME w/o sub.: 82.5 (#4/61)&lt;/li&gt;&lt;li&gt;Momento: 67.7 (#5/5)&lt;/li&gt;&lt;li&gt;RepoMirage: 24.2 (#5/8)&lt;/li&gt;&lt;li&gt;RefSpatialBench: 64.3 (#5/7)&lt;/li&gt;&lt;li&gt;AgentCIBench: 76.9 (#7/15)&lt;/li&gt;&lt;li&gt;MedLayXPlain: 61.5 (#10/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4 Fast&lt;/strong&gt; — ELO 1633, #123&lt;ul&gt;&lt;li&gt;MCP-Universe: 27.27 (#7/27)&lt;/li&gt;&lt;li&gt;HMMT 2025: 93.3 (#28/89)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1&lt;/strong&gt; — ELO 1631, #124&lt;ul&gt;&lt;li&gt;LinAlg-Bench: 100.0 (#1/10)&lt;/li&gt;&lt;li&gt;MedGUIDE: 60.5 (#2/25)&lt;/li&gt;&lt;li&gt;DiagnosticIQ: 65.41 (#8/33)&lt;/li&gt;&lt;li&gt;OJBench: 26.45 (#13/44)&lt;/li&gt;&lt;li&gt;IneqMath: 8.0 (#17/42)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 74.4 (#133/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ring-2.6-1T&lt;/strong&gt; — ELO 1631, #126&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 104.0 (#78/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.2 Exp&lt;/strong&gt; — ELO 1629, #127&lt;ul&gt;&lt;li&gt;EHR-Complex: 59.2 (#3/14)&lt;/li&gt;&lt;li&gt;DVMap: 45.1 (#8/9)&lt;/li&gt;&lt;li&gt;PlanningBench: 29.27 (#10/16)&lt;/li&gt;&lt;li&gt;MCP-Universe: 19.91 (#19/27)&lt;/li&gt;&lt;li&gt;HMMT 2025: 83.6 (#46/89)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.1 Terminus&lt;/strong&gt; — ELO 1629, #128&lt;ul&gt;&lt;li&gt;LiveFMBench: 38.48 (#3/11)&lt;/li&gt;&lt;li&gt;AsyncTool: 28.93 (#5/19)&lt;/li&gt;&lt;li&gt;LingOly-TOO: 42.2 (#5/16)&lt;/li&gt;&lt;li&gt;MCP-Universe: 21.65 (#18/27)&lt;/li&gt;&lt;li&gt;ALE-Bench: 745.17 (#38/79)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 1.71 (#76/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KAT Coder Pro V2&lt;/strong&gt; — ELO 1629, #129&lt;ul&gt;&lt;li&gt;AA-LCR: 66.0 (#57/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#223/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 VL 235B A22B&lt;/strong&gt; — ELO 1627, #130&lt;ul&gt;&lt;li&gt;Visual Aesthetic Benchmark (VAB): 44.9 (#19/23)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.7&lt;/strong&gt; — ELO 1626, #131&lt;ul&gt;&lt;li&gt;When Lower Privileges Suffice: 43.4 (#3/11)&lt;/li&gt;&lt;li&gt;DataClawBench: 41.3 (#3/8)&lt;/li&gt;&lt;li&gt;SearchGEO: 17.4 (#5/13)&lt;/li&gt;&lt;li&gt;TimeSage-MT: 36.44 (#5/6)&lt;/li&gt;&lt;li&gt;From Knowing to Doing: 56.31 (#5/10)&lt;/li&gt;&lt;li&gt;EnvSimBench: 41.8 (#5/8)&lt;/li&gt;&lt;li&gt;Personalized Turn-Level User Conversation Sati: 4.26 (#7/7)&lt;/li&gt;&lt;li&gt;RepoMirage: 14.8 (#7/8)&lt;/li&gt;&lt;li&gt;Claw-Anything: 13.5 (#8/9)&lt;/li&gt;&lt;li&gt;Can LLM Agents Respond to Disasters? Benchmark: 48.35 (#8/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2.1&lt;/strong&gt; — ELO 1626, #132&lt;ul&gt;&lt;li&gt;ContractBench: 60.6 (#8/20)&lt;/li&gt;&lt;li&gt;MedScribe: 80.78 (#23/61)&lt;/li&gt;&lt;li&gt;MATH 500: 89.0 (#27/58)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 55.84 (#33/54)&lt;/li&gt;&lt;li&gt;ClawProBench: 48.08 (#45/57)&lt;/li&gt;&lt;li&gt;MedCode: 34.08 (#46/63)&lt;/li&gt;&lt;li&gt;ALE-Bench: 623.83 (#48/79)&lt;/li&gt;&lt;li&gt;Finance Agent v1.1: 33.35 (#49/56)&lt;/li&gt;&lt;li&gt;MGSM: 87.85 (#51/67)&lt;/li&gt;&lt;li&gt;IOI: 2.33 (#53/58)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O4 Mini&lt;/strong&gt; — ELO 1625, #133&lt;ul&gt;&lt;li&gt;GraphARC: 87.0 (#2/11)&lt;/li&gt;&lt;li&gt;TRLawBench: 84.4 (#2/32)&lt;/li&gt;&lt;li&gt;FormInv: 80.0 (#3/9)&lt;/li&gt;&lt;li&gt;Reward Hacking Benchmark (RHB): 8.4 (#3/13)&lt;/li&gt;&lt;li&gt;MedGUIDE: 58.9 (#3/25)&lt;/li&gt;&lt;li&gt;FinanceArena: 48.6 (#3/19)&lt;/li&gt;&lt;li&gt;C4STYLI: 70.1 (#4/18)&lt;/li&gt;&lt;li&gt;A2RBench: 33.7 (#4/14)&lt;/li&gt;&lt;li&gt;MedFrameQA: 49.4 (#4/11)&lt;/li&gt;&lt;li&gt;When Simulation Lies: 50.2 (#5/22)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1 0528&lt;/strong&gt; — ELO 1625, #134&lt;ul&gt;&lt;li&gt;USAMO25: 30.06 (#4/13)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Icarus Verilog): 78.86 (#4/44)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Verilator): 78.08 (#4/44)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Icarus Verilog): 76.79 (#4/44)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Verilator): 75.83 (#4/44)&lt;/li&gt;&lt;li&gt;TuRTLe Module Completion (NotSoTiny): 20.73 (#5/15)&lt;/li&gt;&lt;li&gt;OR-Space: 55.0 (#7/18)&lt;/li&gt;&lt;li&gt;FinanceArena: 42.9 (#10/19)&lt;/li&gt;&lt;li&gt;FINESSE-Bench: 82.66 (#13/31)&lt;/li&gt;&lt;li&gt;IneqMath: 9.5 (#13/42)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.5&lt;/strong&gt; — ELO 1625, #135&lt;ul&gt;&lt;li&gt;MAVEN-Bench: 43.0 (#6/8)&lt;/li&gt;&lt;li&gt;MCP-Universe: 24.68 (#12/27)&lt;/li&gt;&lt;li&gt;MultiNRC: 17.44 (#34/39)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1276.3 (#38/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1357.0 (#61/123)&lt;/li&gt;&lt;li&gt;ALE-Bench: 344.82 (#66/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash&lt;/strong&gt; — ELO 1624, #136&lt;ul&gt;&lt;li&gt;K-FinHallu: 86.4 (#1/12)&lt;/li&gt;&lt;li&gt;OmniToM: 85.95 (#1/9)&lt;/li&gt;&lt;li&gt;CommonWhy: 27.7 (#1/7)&lt;/li&gt;&lt;li&gt;MedFrameQA: 54.75 (#1/11)&lt;/li&gt;&lt;li&gt;SocialPersona: 32.9 (#2/6)&lt;/li&gt;&lt;li&gt;TriViewBench: 79.55 (#2/19)&lt;/li&gt;&lt;li&gt;Seeing Isn't Knowing: 53.2 (#2/9)&lt;/li&gt;&lt;li&gt;K12-Bench: 48.3 (#2/11)&lt;/li&gt;&lt;li&gt;A Matter of TASTE: 66.0 (#3/6)&lt;/li&gt;&lt;li&gt;StakeBench: 17.5 (#3/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3.1&lt;/strong&gt; — ELO 1624, #137&lt;ul&gt;&lt;li&gt;Exploring Autonomous Agentic Data Engineering: 7.13 (#1/6)&lt;/li&gt;&lt;li&gt;EQUITRIAGE: 36.4 (#3/5)&lt;/li&gt;&lt;li&gt;EHR-Complex: 55.9 (#4/14)&lt;/li&gt;&lt;li&gt;When Context Flips, Safety Breaks: 35.9 (#4/12)&lt;/li&gt;&lt;li&gt;LegalCiteBench: 70.5 (#4/21)&lt;/li&gt;&lt;li&gt;POLAR-Bench: 90.81 (#5/22)&lt;/li&gt;&lt;li&gt;ActTraitBench: 0.75 (#6/15)&lt;/li&gt;&lt;li&gt;Disentangling Language Roles in Multilingual L: 78.6 (#7/20)&lt;/li&gt;&lt;li&gt;FinChain: 56.76 (#12/25)&lt;/li&gt;&lt;li&gt;MCP-Universe: 22.08 (#16/27)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 (2025-04-14)&lt;/strong&gt; — ELO 1623, #139&lt;ul&gt;&lt;li&gt;MedAgentGym: 70.15 (#1/29)&lt;/li&gt;&lt;li&gt;HELM Safety: 96.2853 (#9/57)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1520.39 (#60/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen3 Coder&lt;/strong&gt; — ELO 1623, #141&lt;ul&gt;&lt;li&gt;Do Coding Agents Understand Least-Privilege Au: 63.3 (#7/11)&lt;/li&gt;&lt;li&gt;OrgForge-IT: 80.0 (#8/10)&lt;/li&gt;&lt;li&gt;ALE-Bench: 461.45 (#60/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o ChatGPT&lt;/strong&gt; — ELO 1622, #142&lt;ul&gt;&lt;li&gt;WritingBench: 73.22 (#37/66)&lt;/li&gt;&lt;li&gt;AA-LCR: 53.0 (#127/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Sonnet 4 (20250514)&lt;/strong&gt; — ELO 1622, #143&lt;ul&gt;&lt;li&gt;Xent Games: 48.45 (#9/12)&lt;/li&gt;&lt;li&gt;WritingBench: 74.1 (#34/66)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1&lt;/strong&gt; — ELO 1621, #144&lt;ul&gt;&lt;li&gt;NL2Scratch: 99.1 (#1/8)&lt;/li&gt;&lt;li&gt;ComplexFuncBench: 65.5 (#1/18)&lt;/li&gt;&lt;li&gt;EHRBench: 69.43 (#2/31)&lt;/li&gt;&lt;li&gt;AIM-Bench (inventory manager): 20.71 (#3/5)&lt;/li&gt;&lt;li&gt;BehaviorBench: 27.5 (#4/20)&lt;/li&gt;&lt;li&gt;TRLawBench: 80.0 (#5/32)&lt;/li&gt;&lt;li&gt;BigCodeBench-Hard: 31.8 (#5/20)&lt;/li&gt;&lt;li&gt;Defects4J: 45.2 (#5/33)&lt;/li&gt;&lt;li&gt;OPT-BENCH: 58.0 (#7/19)&lt;/li&gt;&lt;li&gt;The Metanym Game: 4.44 (#8/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Omni&lt;/strong&gt; — ELO 1621, #145&lt;ul&gt;&lt;li&gt;Omni-DeepSearch: 9.69 (#6/12)&lt;/li&gt;&lt;li&gt;Sandboxed Coding Agents are Competitive Omni-m: 25.8 (#11/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.5&lt;/strong&gt; — ELO 1620, #146&lt;ul&gt;&lt;li&gt;ComplexFuncBench: 63.0 (#3/18)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1767.86 (#5/108)&lt;/li&gt;&lt;li&gt;HELM Safety: 96.4672 (#8/57)&lt;/li&gt;&lt;li&gt;LingOly-TOO: 25.5 (#10/16)&lt;/li&gt;&lt;li&gt;Multi-IF: 70.8 (#19/33)&lt;/li&gt;&lt;li&gt;ZeroBench: 6.0 (#36/69)&lt;/li&gt;&lt;li&gt;CharXiv-R: 55.4 (#53/60)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;KAT-Coder-Pro V1&lt;/strong&gt; — ELO 1620, #147&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 95.0 (#103/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash (Preview 04-17)&lt;/strong&gt; — ELO 1619, #148&lt;ul&gt;&lt;li&gt;CodeGolf Bench: 55.19 (#3/9)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 46.97 (#17/54)&lt;/li&gt;&lt;li&gt;HELM Safety: 91.1812 (#27/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K2 0905&lt;/strong&gt; — ELO 1617, #149&lt;ul&gt;&lt;li&gt;AutoLogi: 89.5 (#2/10)&lt;/li&gt;&lt;li&gt;GR-Ben: 49.1 (#3/22)&lt;/li&gt;&lt;li&gt;TuRTLe Module Completion (NotSoTiny): 19.0 (#6/15)&lt;/li&gt;&lt;li&gt;LiveFMBench: 30.44 (#7/11)&lt;/li&gt;&lt;li&gt;Xent Games: 42.89 (#10/12)&lt;/li&gt;&lt;li&gt;OJBench: 27.1 (#12/44)&lt;/li&gt;&lt;li&gt;MCP-Universe: 19.91 (#20/27)&lt;/li&gt;&lt;li&gt;MageBench Season 1: 1558.0 (#26/35)&lt;/li&gt;&lt;li&gt;ACEBench: 76.5 (#31/31)&lt;/li&gt;&lt;li&gt;ALE-Bench: 267.13 (#70/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.7 Sonnet&lt;/strong&gt; — ELO 1616, #151&lt;ul&gt;&lt;li&gt;Beyond Continuity: 94.5 (#2/10)&lt;/li&gt;&lt;li&gt;TriViewBench: 68.62 (#3/19)&lt;/li&gt;&lt;li&gt;VRBench: 68.15 (#3/29)&lt;/li&gt;&lt;li&gt;MedFrameQA: 49.67 (#3/11)&lt;/li&gt;&lt;li&gt;VeriTrip: 66.16 (#4/11)&lt;/li&gt;&lt;li&gt;DiagnosticIQ: 70.61 (#4/33)&lt;/li&gt;&lt;li&gt;WildAgtEval: 61.6 (#4/9)&lt;/li&gt;&lt;li&gt;GeoCode Leaderboard: 70.35 (#4/27)&lt;/li&gt;&lt;li&gt;MUSE: 17.92 (#5/15)&lt;/li&gt;&lt;li&gt;FinChain: 57.89 (#5/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 31B&lt;/strong&gt; — ELO 1615, #152&lt;ul&gt;&lt;li&gt;TeleResilienceBench: 29.1 (#1/8)&lt;/li&gt;&lt;li&gt;P3B3: 98.0 (#2/20)&lt;/li&gt;&lt;li&gt;TempGlitch: 52.3 (#2/10)&lt;/li&gt;&lt;li&gt;GRACE: 77.46 (#3/13)&lt;/li&gt;&lt;li&gt;DisasterBench: 66.52 (#3/12)&lt;/li&gt;&lt;li&gt;AgingBench: 7.4 (#3/8)&lt;/li&gt;&lt;li&gt;POLAR-Bench: 91.2 (#3/22)&lt;/li&gt;&lt;li&gt;CodeClinic: 43.4 (#4/8)&lt;/li&gt;&lt;li&gt;HardMTBench: 90.62 (#5/20)&lt;/li&gt;&lt;li&gt;IFMTBench: 79.61 (#5/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 235B A22B 2507 Instruct&lt;/strong&gt; — ELO 1615, #153&lt;ul&gt;&lt;li&gt;LiveFMBench: 15.83 (#10/11)&lt;/li&gt;&lt;li&gt;WritingBench: 80.26 (#18/66)&lt;/li&gt;&lt;li&gt;MCP-Universe: 18.18 (#25/27)&lt;/li&gt;&lt;li&gt;Multi-IF: 77.5 (#28/33)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 82.79 (#64/346)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 87.5 (#112/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 VL 235B A22B Instruct&lt;/strong&gt; — ELO 1615, #154&lt;ul&gt;&lt;li&gt;CFMME: 63.31 (#2/16)&lt;/li&gt;&lt;li&gt;Math-VR: 65.0 (#2/31)&lt;/li&gt;&lt;li&gt;WritingBench: 85.5 (#4/66)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (en): 67.1 (#5/38)&lt;/li&gt;&lt;li&gt;VideoMME w/o sub.: 79.2 (#6/61)&lt;/li&gt;&lt;li&gt;LongWebBench: 5.85 (#7/13)&lt;/li&gt;&lt;li&gt;HarmVideoBench: 79.7 (#9/21)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (zh): 61.8 (#9/37)&lt;/li&gt;&lt;li&gt;MineExplorer: 10.58 (#13/18)&lt;/li&gt;&lt;li&gt;DentalGPT Dental Eval Suite: 51.3 (#13/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Doubao Seed Code&lt;/strong&gt; — ELO 1615, #156&lt;ul&gt;&lt;li&gt;ClawProBench: 59.22 (#18/57)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 95.0 (#100/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 3 Mini Beta&lt;/strong&gt; — ELO 1615, #157&lt;ul&gt;&lt;li&gt;BigCodeBench-Hard: 31.1 (#7/20)&lt;/li&gt;&lt;li&gt;HELM Safety: 90.2239 (#32/57)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1064.5 (#58/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Haiku 4.5&lt;/strong&gt; — ELO 1614, #158&lt;ul&gt;&lt;li&gt;When Safe Skills Collide: 9.0 (#1/9)&lt;/li&gt;&lt;li&gt;LLM-as-a-Reviewer: 99.7 (#2/12)&lt;/li&gt;&lt;li&gt;NRT-Bench: 8.7 (#4/4)&lt;/li&gt;&lt;li&gt;JuICE: 40.38 (#4/10)&lt;/li&gt;&lt;li&gt;DRInQ: 64.0 (#4/13)&lt;/li&gt;&lt;li&gt;SearchGEO: 12.5 (#7/13)&lt;/li&gt;&lt;li&gt;StakeBench: 13.8 (#7/15)&lt;/li&gt;&lt;li&gt;CounterCount: 36.06 (#7/7)&lt;/li&gt;&lt;li&gt;TOBench: 27.0 (#7/18)&lt;/li&gt;&lt;li&gt;MedCTA: 23.08 (#8/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 35B A3B&lt;/strong&gt; — ELO 1614, #159&lt;ul&gt;&lt;li&gt;TIR-Bench: 55.5 (#3/27)&lt;/li&gt;&lt;li&gt;VideoMME w/o sub.: 82.5 (#3/61)&lt;/li&gt;&lt;li&gt;AgentCollabBench: 0.9 (#4/4)&lt;/li&gt;&lt;li&gt;ZEROBench-Sub: 34.1 (#4/45)&lt;/li&gt;&lt;li&gt;MMVU: 72.3 (#5/40)&lt;/li&gt;&lt;li&gt;RefSpatialBench: 63.5 (#6/7)&lt;/li&gt;&lt;li&gt;OJBench: 36.0 (#6/44)&lt;/li&gt;&lt;li&gt;Managing Procedural Memory in LLM Agents: 2.0 (#7/13)&lt;/li&gt;&lt;li&gt;Beyond Function Calling: 37.2 (#9/12)&lt;/li&gt;&lt;li&gt;MedXpertQA: 61.4 (#9/26)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 26B A4B (IT)&lt;/strong&gt; — ELO 1612, #160&lt;ul&gt;&lt;li&gt;NRT-Bench: 12.1 (#1/4)&lt;/li&gt;&lt;li&gt;StemBind: 33.0 (#12/24)&lt;/li&gt;&lt;li&gt;MT-JailBench: 73.42 (#13/21)&lt;/li&gt;&lt;li&gt;SeePhys Pro: 9.0 (#13/16)&lt;/li&gt;&lt;li&gt;ArchSIBench: 52.0 (#15/28)&lt;/li&gt;&lt;li&gt;TableVista: 42.5 (#17/29)&lt;/li&gt;&lt;li&gt;ALE-Bench: 927.17 (#24/79)&lt;/li&gt;&lt;li&gt;SpaceDG: 31.0 (#28/29)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1430.6 (#28/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1286.9 (#66/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiMo-V2-Flash&lt;/strong&gt; — ELO 1612, #163&lt;ul&gt;&lt;li&gt;Fin-RATE: 18.05 (#6/16)&lt;/li&gt;&lt;li&gt;BacktestBench: 40.43 (#14/23)&lt;/li&gt;&lt;li&gt;WildClawBench: 30.8 (#17/20)&lt;/li&gt;&lt;li&gt;ALE-Bench: 737.95 (#39/79)&lt;/li&gt;&lt;li&gt;HMMT 2025: 84.4 (#44/89)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 101.0 (#87/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Preview&lt;/strong&gt; — ELO 1611, #164&lt;ul&gt;&lt;li&gt;FullStackBench en: 65.62 (#1/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ling-3.0-flash&lt;/strong&gt; — ELO 1610, #165&lt;ul&gt;&lt;li&gt;Tau3 Banking: 27.22 (#41/188)&lt;/li&gt;&lt;li&gt;AA GDPval: 1107.63 (#75/184)&lt;/li&gt;&lt;li&gt;Artificial Analysis Intelligence Index: 37.82 (#87/559)&lt;/li&gt;&lt;li&gt;AA GPQA Diamond: 85.45 (#96/560)&lt;/li&gt;&lt;li&gt;AA Humanity's Last Exam: 23.68 (#109/556)&lt;/li&gt;&lt;li&gt;AA CritPt: 1.71 (#113/466)&lt;/li&gt;&lt;li&gt;BenchLM: 49.9 (#122/200)&lt;/li&gt;&lt;li&gt;AA Long Context Reasoning: 67.0 (#125/488)&lt;/li&gt;&lt;li&gt;AA SciCode: 41.09 (#130/554)&lt;/li&gt;&lt;li&gt;AA Omniscience: -17.88 (#134/465)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.5 (Preview)&lt;/strong&gt; — ELO 1609, #166&lt;ul&gt;&lt;li&gt;Open FinLLM Leaderboard: 43.4 (#3/25)&lt;/li&gt;&lt;li&gt;EnigmaEval: 3.18 (#23/39)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 42.11 (#31/54)&lt;/li&gt;&lt;li&gt;WritingBench: 67.61 (#47/66)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1053.3 (#59/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1230.6 (#74/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Sonnet (20241022)&lt;/strong&gt; — ELO 1608, #168&lt;ul&gt;&lt;li&gt;Aider Refactoring Benchmark: 92.1 (#1/10)&lt;/li&gt;&lt;li&gt;MedHELM: 63.3929 (#4/9)&lt;/li&gt;&lt;li&gt;Defects4J: 44.1 (#6/33)&lt;/li&gt;&lt;li&gt;HELM MedQA: 86.4811 (#7/13)&lt;/li&gt;&lt;li&gt;OPT-BENCH: 48.0 (#12/19)&lt;/li&gt;&lt;li&gt;MGSM: 92.58 (#13/67)&lt;/li&gt;&lt;li&gt;ACEBench: 0.76 (#20/31)&lt;/li&gt;&lt;li&gt;OJBench: 10.4 (#27/44)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1420.9 (#46/123)&lt;/li&gt;&lt;li&gt;MATH 500: 72.4 (#48/58)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok Code Fast 1&lt;/strong&gt; — ELO 1608, #169&lt;ul&gt;&lt;li&gt;MCP-Universe: 26.41 (#8/27)&lt;/li&gt;&lt;li&gt;IDE-Bench: 11.25 (#12/15)&lt;/li&gt;&lt;li&gt;IOI: 4.33 (#47/58)&lt;/li&gt;&lt;li&gt;ALE-Bench: 587.73 (#54/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 Omni Plus&lt;/strong&gt; — ELO 1608, #171&lt;ul&gt;&lt;li&gt;Omni-DeepSearch: 13.91 (#4/12)&lt;/li&gt;&lt;li&gt;FraudBench: 0.8 (#20/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Sonnet (20240620)&lt;/strong&gt; — ELO 1607, #172&lt;ul&gt;&lt;li&gt;Clembench Multimodal v1.6.5: 80.77 (#1/20)&lt;/li&gt;&lt;li&gt;HELM Lite: 91.2171 (#2/77)&lt;/li&gt;&lt;li&gt;HELM Safety: 97.6697 (#3/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 3&lt;/strong&gt; — ELO 1607, #173&lt;ul&gt;&lt;li&gt;TukaBench: 31.5 (#2/13)&lt;/li&gt;&lt;li&gt;OPT-BENCH: 63.0 (#2/19)&lt;/li&gt;&lt;li&gt;StoryAlign: 62.4 (#3/15)&lt;/li&gt;&lt;li&gt;PersonaArena: 3.63 (#8/18)&lt;/li&gt;&lt;li&gt;K-12EduBench: 63.91 (#16/23)&lt;/li&gt;&lt;li&gt;MATH 500: 89.8 (#25/58)&lt;/li&gt;&lt;li&gt;MGSM: 91.35 (#26/67)&lt;/li&gt;&lt;li&gt;WritingBench: 71.72 (#43/66)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1149.8 (#48/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1183.5 (#80/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Medium 3.5&lt;/strong&gt; — ELO 1604, #174&lt;ul&gt;&lt;li&gt;Agent Arena - Steerability: 11.31 (#4/46)&lt;/li&gt;&lt;li&gt;Agent Arena - Confirmed Success: 10.43 (#10/46)&lt;/li&gt;&lt;li&gt;Agent Arena: 6.82 (#20/46)&lt;/li&gt;&lt;li&gt;Agent Arena - Praise vs Complaint: 8.71 (#25/46)&lt;/li&gt;&lt;li&gt;Agent Arena - Tool Hallucination: 3.53 (#44/46)&lt;/li&gt;&lt;li&gt;Agent Arena - Bash Recovery: 0.13 (#46/46)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 39.58 (#89/128)&lt;/li&gt;&lt;li&gt;AA-LCR: 61.0 (#93/355)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 96.0 (#97/138)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#268/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ling-2.6-1T&lt;/strong&gt; — ELO 1604, #175&lt;ul&gt;&lt;li&gt;BLXBench: 75.3 (#8/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Sonnet&lt;/strong&gt; — ELO 1601, #178&lt;ul&gt;&lt;li&gt;Translation en to Set1 COMET22: 89.4 (#1/13)&lt;/li&gt;&lt;li&gt;Translation Set1 to en COMET22: 89.1 (#1/13)&lt;/li&gt;&lt;li&gt;AgentLeak: 55.2 (#1/5)&lt;/li&gt;&lt;li&gt;RAGTruth: 86.1 (#1/11)&lt;/li&gt;&lt;li&gt;Chain-of-Procedure: 47.5 (#2/6)&lt;/li&gt;&lt;li&gt;Translation en to Set1 spBleu: 42.5 (#4/13)&lt;/li&gt;&lt;li&gt;AutoLogi: 60.97 (#4/10)&lt;/li&gt;&lt;li&gt;ComplexFuncBench: 61.0 (#4/18)&lt;/li&gt;&lt;li&gt;FullStackBench en: 62.57 (#4/31)&lt;/li&gt;&lt;li&gt;Translation Set1 to en spBleu: 43.5 (#5/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Nano&lt;/strong&gt; — ELO 1600, #182&lt;ul&gt;&lt;li&gt;Honeyval: 96.9 (#1/6)&lt;/li&gt;&lt;li&gt;ABRA: 69.0 (#4/10)&lt;/li&gt;&lt;li&gt;UXBench: 16.2 (#6/8)&lt;/li&gt;&lt;li&gt;STALE: 9.8 (#8/15)&lt;/li&gt;&lt;li&gt;CheXpercept: 76.9 (#10/14)&lt;/li&gt;&lt;li&gt;MedCTA: 20.3 (#10/18)&lt;/li&gt;&lt;li&gt;SearchGEO: 6.4 (#11/13)&lt;/li&gt;&lt;li&gt;The Wrong Kind of Right: 21.5 (#12/26)&lt;/li&gt;&lt;li&gt;Can LLM Agents Respond to Disasters? Benchmark: 38.14 (#12/15)&lt;/li&gt;&lt;li&gt;Agentic Skills Evaluation Framework: 81.9 (#13/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash Lite (Preview 09-2025)&lt;/strong&gt; — ELO 1600, #183&lt;ul&gt;&lt;li&gt;MedScribe: 75.82 (#40/61)&lt;/li&gt;&lt;li&gt;MGSM: 89.53 (#42/67)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax-M2&lt;/strong&gt; — ELO 1599, #185&lt;ul&gt;&lt;li&gt;ContractBench: 53.5 (#10/20)&lt;/li&gt;&lt;li&gt;AA-LCR: 61.0 (#92/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.9 (#97/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 Mini&lt;/strong&gt; — ELO 1598, #186&lt;ul&gt;&lt;li&gt;GraphARC: 81.0 (#3/11)&lt;/li&gt;&lt;li&gt;ComplexFuncBench: 17.6 (#12/18)&lt;/li&gt;&lt;li&gt;IneqMath: 9.5 (#14/42)&lt;/li&gt;&lt;li&gt;Multi-IF: 79.5 (#32/33)&lt;/li&gt;&lt;li&gt;CAIS Text Capabilities Index: 7.8 (#37/40)&lt;/li&gt;&lt;li&gt;CAIS Risk Index: 69.9 (#43/45)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 75.3 (#124/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 VL 32B&lt;/strong&gt; — ELO 1596, #189&lt;ul&gt;&lt;li&gt;AgroVG: 37.5 (#3/13)&lt;/li&gt;&lt;li&gt;LaViSA: 81.9 (#4/10)&lt;/li&gt;&lt;li&gt;SVFSearch: 90.8 (#4/75)&lt;/li&gt;&lt;li&gt;From Hallucination to Grounding: 51.56 (#5/13)&lt;/li&gt;&lt;li&gt;CardioLens: 51.94 (#6/24)&lt;/li&gt;&lt;li&gt;LiveK12Bench: 82.7 (#7/12)&lt;/li&gt;&lt;li&gt;EgoCoT-Bench: 67.09 (#8/20)&lt;/li&gt;&lt;li&gt;DocScope: 51.8 (#11/23)&lt;/li&gt;&lt;li&gt;TRAP: 15.8 (#15/22)&lt;/li&gt;&lt;li&gt;Done, But Not Sure: 18.9 (#15/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 405B&lt;/strong&gt; — ELO 1595, #190&lt;ul&gt;&lt;li&gt;BBH: 82.9 (#2/16)&lt;/li&gt;&lt;li&gt;TW-LegalBench: 60.5 (#7/13)&lt;/li&gt;&lt;li&gt;NarrativeWorldBench: 71.0 (#8/10)&lt;/li&gt;&lt;li&gt;Balrog: 27.9 (#8/16)&lt;/li&gt;&lt;li&gt;Multi-IF: 0.85 (#12/33)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Icarus Verilog): 54.74 (#15/44)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Verilator): 55.06 (#15/44)&lt;/li&gt;&lt;li&gt;ComplexFuncBench: 4.0 (#16/18)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Icarus Verilog): 53.22 (#17/44)&lt;/li&gt;&lt;li&gt;MixRea: 12.4 (#19/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mercury 2&lt;/strong&gt; — ELO 1595, #191&lt;ul&gt;&lt;li&gt;ALE-Bench: 785.58 (#34/79)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 38.66 (#94/128)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 92.0 (#114/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 235B A22B&lt;/strong&gt; — ELO 1594, #192&lt;ul&gt;&lt;li&gt;ASPI: 41.9 (#2/10)&lt;/li&gt;&lt;li&gt;FinVerBench: 65.7 (#3/15)&lt;/li&gt;&lt;li&gt;ClinPivot: 65.74 (#3/6)&lt;/li&gt;&lt;li&gt;Fin-RATE: 24.39 (#3/16)&lt;/li&gt;&lt;li&gt;TW-LegalBench: 69.1 (#4/13)&lt;/li&gt;&lt;li&gt;CodeGolf Bench: 48.24 (#4/9)&lt;/li&gt;&lt;li&gt;Prosa: 80.1 (#4/16)&lt;/li&gt;&lt;li&gt;BacktestBench: 55.01 (#5/23)&lt;/li&gt;&lt;li&gt;EHR-Complex: 53.4 (#6/14)&lt;/li&gt;&lt;li&gt;Ukrainian Legal Text Benchmark (EDRSR subset): 79.2 (#6/7)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Next 80B A3B Instruct&lt;/strong&gt; — ELO 1594, #193&lt;ul&gt;&lt;li&gt;WritingBench: 87.3 (#1/66)&lt;/li&gt;&lt;li&gt;ATLAS: 28.77 (#19/23)&lt;/li&gt;&lt;li&gt;Multi-IF: 75.8 (#26/33)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 85.3 (#118/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen3 Coder Next&lt;/strong&gt; — ELO 1594, #194&lt;ul&gt;&lt;li&gt;AgentTrap: 58.0 (#5/8)&lt;/li&gt;&lt;li&gt;RepoMirage: 22.6 (#6/8)&lt;/li&gt;&lt;li&gt;Agentic Skills Evaluation Framework: 70.8 (#17/19)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 93.0 (#107/138)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 32.29 (#112/128)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Medium 3.1&lt;/strong&gt; — ELO 1593, #195&lt;ul&gt;&lt;li&gt;MageBench Season 1: 1569.0 (#25/35)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1480.6 (#39/123)&lt;/li&gt;&lt;li&gt;ALE-Bench: 210.18 (#76/79)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 33.8 (#110/128)&lt;/li&gt;&lt;li&gt;AA-LCR: 19.7 (#225/355)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 68.33 (#235/346)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#267/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Coder 480B A35B Instruct&lt;/strong&gt; — ELO 1593, #196&lt;ul&gt;&lt;li&gt;TuRTLe Module Completion (NotSoTiny): 23.43 (#3/15)&lt;/li&gt;&lt;li&gt;LiveFMBench: 30.37 (#8/11)&lt;/li&gt;&lt;li&gt;MCP-Universe: 22.94 (#14/27)&lt;/li&gt;&lt;li&gt;AA-LCR: 42.3 (#155/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#313/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o&lt;/strong&gt; — ELO 1592, #197&lt;ul&gt;&lt;li&gt;DVMap: 48.5 (#2/9)&lt;/li&gt;&lt;li&gt;AIM-Bench (inventory manager): 15.14 (#2/5)&lt;/li&gt;&lt;li&gt;VRBench: 68.68 (#2/29)&lt;/li&gt;&lt;li&gt;ECLeKTic: 38.8 (#2/14)&lt;/li&gt;&lt;li&gt;PhiBench: 72.4 (#2/10)&lt;/li&gt;&lt;li&gt;LLM Game Benchmark: 40.3 (#3/7)&lt;/li&gt;&lt;li&gt;Beyond Continuity: 70.8 (#4/10)&lt;/li&gt;&lt;li&gt;Aider Refactoring Benchmark: 62.9 (#4/10)&lt;/li&gt;&lt;li&gt;TW-LegalBench: 66.2 (#5/13)&lt;/li&gt;&lt;li&gt;TriBench-Ko: 71.5 (#5/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-OSS-120B&lt;/strong&gt; — ELO 1592, #198&lt;ul&gt;&lt;li&gt;Do Agents Know What They Can't Do? Evaluating: 60.7 (#2/9)&lt;/li&gt;&lt;li&gt;Time to REFLECT: 46.5 (#2/14)&lt;/li&gt;&lt;li&gt;WildAgtEval: 62.5 (#3/9)&lt;/li&gt;&lt;li&gt;Legal Hallucination Detection Benchmark (no ex: 34.4 (#4/6)&lt;/li&gt;&lt;li&gt;ArtifactsBench: 57.69 (#4/7)&lt;/li&gt;&lt;li&gt;DiagFlowBench: 76.2 (#5/10)&lt;/li&gt;&lt;li&gt;MAVEN-Bench: 48.0 (#5/8)&lt;/li&gt;&lt;li&gt;Decomposing and Measuring Evaluation Awareness: 1.3 (#5/9)&lt;/li&gt;&lt;li&gt;SCICONVBENCH: 72.6 (#5/5)&lt;/li&gt;&lt;li&gt;CodeClinic: 36.1 (#5/8)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 3 Mini&lt;/strong&gt; — ELO 1592, #199&lt;ul&gt;&lt;li&gt;Balrog: 29.5 (#7/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3 Super&lt;/strong&gt; — ELO 1591, #201&lt;ul&gt;&lt;li&gt;EQUITRIAGE: 35.2 (#4/5)&lt;/li&gt;&lt;li&gt;HMMT 2025: 94.73 (#18/89)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 3.14 (#66/138)&lt;/li&gt;&lt;li&gt;ALE-Bench: 213.9 (#75/79)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 104.0 (#77/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Devstral 2&lt;/strong&gt; — ELO 1591, #202&lt;ul&gt;&lt;li&gt;PrepBench: 33.3 (#8/10)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#159/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 30.0 (#189/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM 4.5 Air&lt;/strong&gt; — ELO 1590, #203&lt;ul&gt;&lt;li&gt;MCP-Universe: 19.48 (#21/27)&lt;/li&gt;&lt;li&gt;MultiNRC: 10.43 (#37/39)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 81.47 (#87/346)&lt;/li&gt;&lt;li&gt;AA-LCR: 43.7 (#152/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#182/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 3&lt;/strong&gt; — ELO 1590, #204&lt;ul&gt;&lt;li&gt;ROK-FORTRESS: 28.4 (#1/14)&lt;/li&gt;&lt;li&gt;XL-SafetyBench: 98.8 (#1/10)&lt;/li&gt;&lt;li&gt;FactoryBench: 17.9 (#2/4)&lt;/li&gt;&lt;li&gt;Ukrainian Legal Text Benchmark (EDRSR subset): 81.1 (#4/7)&lt;/li&gt;&lt;li&gt;Greenland Sovereignty Game (implicitly as a st: 16.2 (#4/8)&lt;/li&gt;&lt;li&gt;SWE-PRBench: 14.7 (#4/8)&lt;/li&gt;&lt;li&gt;ABRA: 67.0 (#6/10)&lt;/li&gt;&lt;li&gt;Qiskit QuantumKatas: 48.6 (#11/16)&lt;/li&gt;&lt;li&gt;DentalGPT Dental Eval Suite: 48.6 (#14/16)&lt;/li&gt;&lt;li&gt;StereoTales: 109.0 (#22/23)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3 (0324)&lt;/strong&gt; — ELO 1590, #205&lt;ul&gt;&lt;li&gt;RefusalBench: 47.5 (#3/19)&lt;/li&gt;&lt;li&gt;HalluWorld: 15.4 (#4/13)&lt;/li&gt;&lt;li&gt;GeoCode Leaderboard: 70.25 (#5/27)&lt;/li&gt;&lt;li&gt;CodeGolf Bench: 38.0 (#7/9)&lt;/li&gt;&lt;li&gt;Defects4J: 43.0 (#8/33)&lt;/li&gt;&lt;li&gt;LiveFMBench: 24.29 (#9/11)&lt;/li&gt;&lt;li&gt;OJBench: 25.54 (#16/44)&lt;/li&gt;&lt;li&gt;IneqMath: 7.0 (#18/42)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1473.8 (#41/123)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1082.2 (#54/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 Mini (2025-01-31)&lt;/strong&gt; — ELO 1590, #206&lt;ul&gt;&lt;li&gt;BigCodeBench-Hard: 33.1 (#1/20)&lt;/li&gt;&lt;li&gt;MedHELM: 64.1071 (#2/9)&lt;/li&gt;&lt;li&gt;HELM MedQA: 92.0477 (#5/13)&lt;/li&gt;&lt;li&gt;SciPredict: 19.84 (#7/15)&lt;/li&gt;&lt;li&gt;HELM Safety: 96.1961 (#10/57)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1684.99 (#18/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 Mini&lt;/strong&gt; — ELO 1589, #207&lt;ul&gt;&lt;li&gt;AgentCollabBench: 3.4 (#2/4)&lt;/li&gt;&lt;li&gt;When2Speak: 49.9 (#2/6)&lt;/li&gt;&lt;li&gt;StructEval: 75.64 (#2/12)&lt;/li&gt;&lt;li&gt;EO-Gym: 64.0 (#3/11)&lt;/li&gt;&lt;li&gt;Paraphrase-Induced Output-Mode Collapse: 26.2 (#4/5)&lt;/li&gt;&lt;li&gt;MedAgentGym: 61.72 (#4/29)&lt;/li&gt;&lt;li&gt;EHRBench: 66.79 (#5/31)&lt;/li&gt;&lt;li&gt;LLM-as-a-Reviewer: 60.7 (#5/12)&lt;/li&gt;&lt;li&gt;RecoAtlas: 24.4 (#5/12)&lt;/li&gt;&lt;li&gt;BigCodeBench-Hard: 31.8 (#6/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 2 (Jul)&lt;/strong&gt; — ELO 1587, #209&lt;ul&gt;&lt;li&gt;RefusalBench: 87.2 (#2/19)&lt;/li&gt;&lt;li&gt;RAGTruth: 85.9 (#2/11)&lt;/li&gt;&lt;li&gt;Multi-IF: 0.81 (#7/33)&lt;/li&gt;&lt;li&gt;ComplexFuncBench: 20.1 (#11/18)&lt;/li&gt;&lt;li&gt;HELM Lite: 78.7704 (#11/77)&lt;/li&gt;&lt;li&gt;Defects4J: 24.5 (#25/33)&lt;/li&gt;&lt;li&gt;HealthBench Hard: 35.0 (#30/55)&lt;/li&gt;&lt;li&gt;AA-LCR: 1.7 (#293/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.6V&lt;/strong&gt; — ELO 1587, #210&lt;ul&gt;&lt;li&gt;MechVQA: 78.91 (#2/17)&lt;/li&gt;&lt;li&gt;LithoBench: 94.5 (#3/13)&lt;/li&gt;&lt;li&gt;LongWebBench: 5.96 (#6/13)&lt;/li&gt;&lt;li&gt;ROSE: 20.7 (#9/10)&lt;/li&gt;&lt;li&gt;OmniMatBench: 21.2 (#11/13)&lt;/li&gt;&lt;li&gt;CULTURE-MT: 16.07 (#11/15)&lt;/li&gt;&lt;li&gt;TOBench: 14.0 (#11/18)&lt;/li&gt;&lt;li&gt;CheXpercept: 69.3 (#12/14)&lt;/li&gt;&lt;li&gt;From Perception to Action: 7.3 (#14/16)&lt;/li&gt;&lt;li&gt;Perception or Prejudice: 4.6 (#17/27)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;INTELLECT-3&lt;/strong&gt; — ELO 1587, #211&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 88.0 (#120/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3 Chat&lt;/strong&gt; — ELO 1586, #213&lt;ul&gt;&lt;li&gt;ChaosBench-Logic v2: 46.9 (#4/10)&lt;/li&gt;&lt;li&gt;ATC Safety-Oriented Language Understanding Eval: 40.03 (#9/11)&lt;/li&gt;&lt;li&gt;Open FinLLM Leaderboard: 29.49 (#9/25)&lt;/li&gt;&lt;li&gt;Xent Games: 35.48 (#11/12)&lt;/li&gt;&lt;li&gt;Natural2Code: 33.2 (#19/30)&lt;/li&gt;&lt;li&gt;ACEBench: 0.79 (#23/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 4 Maverick&lt;/strong&gt; — ELO 1585, #214&lt;ul&gt;&lt;li&gt;XL-SafetyBench: 92.0 (#2/10)&lt;/li&gt;&lt;li&gt;TableVista: 54.7 (#3/29)&lt;/li&gt;&lt;li&gt;DentalGPT Dental Eval Suite: 58.5 (#3/16)&lt;/li&gt;&lt;li&gt;TukaBench: 21.9 (#4/13)&lt;/li&gt;&lt;li&gt;CodeGolf Bench: 44.85 (#5/9)&lt;/li&gt;&lt;li&gt;ClinPivot: 61.93 (#6/6)&lt;/li&gt;&lt;li&gt;AssertLLM2: 12.69 (#6/6)&lt;/li&gt;&lt;li&gt;FrontierOR: 13.0 (#7/7)&lt;/li&gt;&lt;li&gt;HalluScore: 1.33 (#10/17)&lt;/li&gt;&lt;li&gt;DiagnosticIQ: 63.29 (#11/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.0 Flash&lt;/strong&gt; — ELO 1585, #215&lt;ul&gt;&lt;li&gt;Natural2Code: 92.9 (#1/30)&lt;/li&gt;&lt;li&gt;ERGeoBench: 5.77 (#3/9)&lt;/li&gt;&lt;li&gt;RoboBench: 45.04 (#4/15)&lt;/li&gt;&lt;li&gt;XDomainBench: 27.2 (#7/14)&lt;/li&gt;&lt;li&gt;StructEval: 62.55 (#7/12)&lt;/li&gt;&lt;li&gt;AfroBench-Lite: 66.43 (#7/24)&lt;/li&gt;&lt;li&gt;OPT-BENCH: 53.0 (#10/19)&lt;/li&gt;&lt;li&gt;LibEvoBench: 66.0 (#11/13)&lt;/li&gt;&lt;li&gt;Time to REFLECT: 4.5 (#14/14)&lt;/li&gt;&lt;li&gt;K-12EduBench: 64.05 (#15/23)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 72B Instruct&lt;/strong&gt; — ELO 1583, #217&lt;ul&gt;&lt;li&gt;INVESTORBENCH: 46.15 (#1/14)&lt;/li&gt;&lt;li&gt;C4STYLI: 79.9 (#2/18)&lt;/li&gt;&lt;li&gt;ThaiSafetyBench: 10.99 (#4/24)&lt;/li&gt;&lt;li&gt;PhiBench: 64.6 (#4/10)&lt;/li&gt;&lt;li&gt;Open FinLLM Leaderboard: 41.36 (#5/25)&lt;/li&gt;&lt;li&gt;AutoLogi: 53.5 (#7/10)&lt;/li&gt;&lt;li&gt;TuRTLe Module Completion (NotSoTiny): 14.7 (#8/15)&lt;/li&gt;&lt;li&gt;RAGTruth: 81.9 (#9/11)&lt;/li&gt;&lt;li&gt;HealthBench Hard: 49.0 (#11/55)&lt;/li&gt;&lt;li&gt;FullStackBench en: 56.88 (#11/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1&lt;/strong&gt; — ELO 1583, #218&lt;ul&gt;&lt;li&gt;Enhancing Agent Safety Judgment: 94.53 (#1/6)&lt;/li&gt;&lt;li&gt;LexGenius: 64.59 (#1/9)&lt;/li&gt;&lt;li&gt;MedHELM: 66.25 (#1/9)&lt;/li&gt;&lt;li&gt;CodeGolf Bench: 60.21 (#2/9)&lt;/li&gt;&lt;li&gt;Plant, Persist, Trigger: 42.7 (#2/7)&lt;/li&gt;&lt;li&gt;Disentangling Language Roles in Multilingual L: 82.2 (#2/20)&lt;/li&gt;&lt;li&gt;OpenHuEval: 62.31 (#2/10)&lt;/li&gt;&lt;li&gt;EduGuardBench: 75.0 (#2/14)&lt;/li&gt;&lt;li&gt;Exploring Autonomous Agentic Data Engineering: 2.5 (#3/6)&lt;/li&gt;&lt;li&gt;Decomposing and Measuring Evaluation Awareness: 5.6 (#3/9)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 12B&lt;/strong&gt; — ELO 1583, #220&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 92.0 (#112/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hermes 4 405B&lt;/strong&gt; — ELO 1582, #221&lt;ul&gt;&lt;li&gt;EQ-Bench: 1361.4 (#36/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1416.8 (#47/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 9B&lt;/strong&gt; — ELO 1581, #223&lt;ul&gt;&lt;li&gt;Managing Procedural Memory in LLM Agents: 3.0 (#2/13)&lt;/li&gt;&lt;li&gt;Honeyval: 63.1 (#4/6)&lt;/li&gt;&lt;li&gt;OpenComputer: 7.8 (#7/8)&lt;/li&gt;&lt;li&gt;TeleResilienceBench: 17.4 (#7/8)&lt;/li&gt;&lt;li&gt;IFMTBench: 71.22 (#10/15)&lt;/li&gt;&lt;li&gt;SeePhys Pro: 12.8 (#10/16)&lt;/li&gt;&lt;li&gt;Multi-domain Multi-modal Document Classificati: 38.69 (#13/15)&lt;/li&gt;&lt;li&gt;STT-Arena: 19.53 (#16/23)&lt;/li&gt;&lt;li&gt;HMMT February 2026: 71.21 (#23/25)&lt;/li&gt;&lt;li&gt;HMMT 2025: 83.2 (#48/89)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.0 Flash (001)&lt;/strong&gt; — ELO 1581, #224&lt;ul&gt;&lt;li&gt;Defects4J: 33.0 (#15/33)&lt;/li&gt;&lt;li&gt;MATH 500: 88.0 (#29/58)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 39.85 (#35/54)&lt;/li&gt;&lt;li&gt;EnigmaEval: 0.63 (#37/39)&lt;/li&gt;&lt;li&gt;MGSM: 89.02 (#48/67)&lt;/li&gt;&lt;li&gt;EQ-Bench: 910.9 (#66/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1248.8 (#69/123)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#168/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 28.3 (#194/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o (2024-11-20)&lt;/strong&gt; — ELO 1581, #225&lt;ul&gt;&lt;li&gt;Defects4J: 35.0 (#12/33)&lt;/li&gt;&lt;li&gt;BigCodeBench-Hard: 27.7 (#20/20)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 59.7 (#26/54)&lt;/li&gt;&lt;li&gt;LVBench: 48.9 (#27/49)&lt;/li&gt;&lt;li&gt;ACEBench: 0.9 (#29/31)&lt;/li&gt;&lt;li&gt;MGSM: 90.36 (#38/67)&lt;/li&gt;&lt;li&gt;MATH 500: 74.0 (#45/58)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#191/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Magistral Medium 1.2&lt;/strong&gt; — ELO 1581, #226&lt;ul&gt;&lt;li&gt;IOI: 0.67 (#57/58)&lt;/li&gt;&lt;li&gt;MGSM: 74.62 (#64/67)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 39.24 (#91/128)&lt;/li&gt;&lt;li&gt;CritPt: 0.3 (#129/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 51.3 (#134/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;North Mini Code&lt;/strong&gt; — ELO 1581, #228&lt;ul&gt;&lt;li&gt;AA-LCR: 32.3 (#181/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 72B&lt;/strong&gt; — ELO 1580, #229&lt;ul&gt;&lt;li&gt;NeedleBench: 81.02 (#1/12)&lt;/li&gt;&lt;li&gt;StatABench: 60.6 (#3/9)&lt;/li&gt;&lt;li&gt;The Wrong Kind of Right: 38.6 (#3/26)&lt;/li&gt;&lt;li&gt;MIRAGE: 22.0 (#3/6)&lt;/li&gt;&lt;li&gt;AIM-Bench (inventory manager): 21.28 (#4/5)&lt;/li&gt;&lt;li&gt;BBH: 79.8 (#4/16)&lt;/li&gt;&lt;li&gt;StressEval: 33.9 (#5/10)&lt;/li&gt;&lt;li&gt;MUSE: 10.38 (#7/15)&lt;/li&gt;&lt;li&gt;AttuneBench: 52.23 (#7/11)&lt;/li&gt;&lt;li&gt;MixRea: 16.0 (#7/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 405B Instruct&lt;/strong&gt; — ELO 1580, #230&lt;ul&gt;&lt;li&gt;AutoLogi: 59.42 (#5/10)&lt;/li&gt;&lt;li&gt;RAGTruth: 82.9 (#5/11)&lt;/li&gt;&lt;li&gt;ComplexMCP: 26.94 (#9/17)&lt;/li&gt;&lt;li&gt;Defects4J: 28.9 (#19/33)&lt;/li&gt;&lt;li&gt;EQ-Bench: 799.0 (#73/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 969.8 (#91/123)&lt;/li&gt;&lt;li&gt;AA-LCR: 24.3 (#206/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#240/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V3&lt;/strong&gt; — ELO 1579, #232&lt;ul&gt;&lt;li&gt;MIRAGE: 26.0 (#1/6)&lt;/li&gt;&lt;li&gt;Diagnosing LLM Arbitration Behavior over Pre-e: 23.5 (#1/7)&lt;/li&gt;&lt;li&gt;AIM-Bench (inventory manager): 14.72 (#1/5)&lt;/li&gt;&lt;li&gt;K-12EduBench: 79.67 (#2/23)&lt;/li&gt;&lt;li&gt;LinAlg-Bench: 99.5 (#3/10)&lt;/li&gt;&lt;li&gt;OpenHuEval: 57.1 (#3/10)&lt;/li&gt;&lt;li&gt;MedAgentBench: 62.67 (#3/12)&lt;/li&gt;&lt;li&gt;StatABench: 57.4 (#4/9)&lt;/li&gt;&lt;li&gt;AIPatient Arena: 4.75 (#4/5)&lt;/li&gt;&lt;li&gt;EduGuardBench: 73.0 (#4/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5 Nano&lt;/strong&gt; — ELO 1578, #236&lt;ul&gt;&lt;li&gt;Seneca-TRBench: 92.9 (#2/5)&lt;/li&gt;&lt;li&gt;CommunityFact: 75.59 (#3/15)&lt;/li&gt;&lt;li&gt;Checkup2Action: 44.9 (#3/8)&lt;/li&gt;&lt;li&gt;MultiEmo-Bench: 72.5 (#11/12)&lt;/li&gt;&lt;li&gt;RealWorldQA: 71.8 (#11/12)&lt;/li&gt;&lt;li&gt;Xent Games: 23.27 (#12/12)&lt;/li&gt;&lt;li&gt;DRInQ: 45.0 (#13/13)&lt;/li&gt;&lt;li&gt;ArchSIBench: 51.9 (#16/28)&lt;/li&gt;&lt;li&gt;EHRBench: 57.8 (#19/31)&lt;/li&gt;&lt;li&gt;CAIS Risk Index: 53.6 (#23/45)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 26B A4B&lt;/strong&gt; — ELO 1576, #239&lt;ul&gt;&lt;li&gt;BIG-Bench Extra Hard: 64.8 (#2/20)&lt;/li&gt;&lt;li&gt;HardMTBench: 89.65 (#8/20)&lt;/li&gt;&lt;li&gt;Qiskit QuantumKatas: 61.4 (#8/16)&lt;/li&gt;&lt;li&gt;MedXpertQA: 58.1 (#11/26)&lt;/li&gt;&lt;li&gt;Trip+: 61.36 (#12/18)&lt;/li&gt;&lt;li&gt;MMGist: 45.6 (#13/27)&lt;/li&gt;&lt;li&gt;RankJudge: 1444.0 (#13/21)&lt;/li&gt;&lt;li&gt;ContractBench: 38.4 (#14/20)&lt;/li&gt;&lt;li&gt;CiteVQA: 3.0 (#17/20)&lt;/li&gt;&lt;li&gt;PerfCodeBench: 38.13 (#17/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o (2024-08-06)&lt;/strong&gt; — ELO 1576, #240&lt;ul&gt;&lt;li&gt;Clembench Multimodal v1.6.5: 80.04 (#2/20)&lt;/li&gt;&lt;li&gt;AutoLogi: 62.04 (#3/10)&lt;/li&gt;&lt;li&gt;OPT-BENCH: 61.0 (#4/19)&lt;/li&gt;&lt;li&gt;HumanEval+: 87.2 (#4/24)&lt;/li&gt;&lt;li&gt;EvalPlus: 79.7 (#5/25)&lt;/li&gt;&lt;li&gt;Generate README Eval: 33.13 (#6/14)&lt;/li&gt;&lt;li&gt;MedAgentGym: 48.75 (#7/29)&lt;/li&gt;&lt;li&gt;AfroBench-Lite: 65.8 (#8/24)&lt;/li&gt;&lt;li&gt;The Metanym Game: 3.49 (#9/12)&lt;/li&gt;&lt;li&gt;Forge: 62.1 (#9/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o (2024-05-13)&lt;/strong&gt; — ELO 1574, #241&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1825.22 (#1/108)&lt;/li&gt;&lt;li&gt;ToolSandbox: 73.0 (#1/13)&lt;/li&gt;&lt;li&gt;HELM Lite: 95.9457 (#1/77)&lt;/li&gt;&lt;li&gt;RepoQA: 90.6 (#3/33)&lt;/li&gt;&lt;li&gt;RAGTruth: 84.3 (#3/11)&lt;/li&gt;&lt;li&gt;Clembench Multimodal v1.6.5: 69.56 (#4/20)&lt;/li&gt;&lt;li&gt;MedHELM: 56.9643 (#5/9)&lt;/li&gt;&lt;li&gt;HELM MedQA: 87.674 (#6/13)&lt;/li&gt;&lt;li&gt;HELM Safety: 94.5905 (#15/57)&lt;/li&gt;&lt;li&gt;LVBench: 30.8 (#41/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Pro (001)&lt;/strong&gt; — ELO 1574, #242&lt;ul&gt;&lt;li&gt;ToolSandbox: 60.4 (#6/13)&lt;/li&gt;&lt;li&gt;MedHELM: 24.1071 (#9/9)&lt;/li&gt;&lt;li&gt;HELM Lite: 78.1802 (#12/77)&lt;/li&gt;&lt;li&gt;HELM MedQA: 76.9384 (#12/13)&lt;/li&gt;&lt;li&gt;HELM Safety: 92.4464 (#25/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DiffusionGemma 26B-A4B&lt;/strong&gt; — ELO 1574, #243&lt;ul&gt;&lt;li&gt;BIG-Bench Extra Hard: 47.6 (#4/20)&lt;/li&gt;&lt;li&gt;MedXpertQA: 49.0 (#13/26)&lt;/li&gt;&lt;li&gt;OmniDocBench 1.5: 31.9 (#59/64)&lt;/li&gt;&lt;li&gt;CritPt: 0.3 (#118/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 14.3 (#245/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash Lite&lt;/strong&gt; — ELO 1573, #244&lt;ul&gt;&lt;li&gt;MCJudgeBench: 85.5 (#2/7)&lt;/li&gt;&lt;li&gt;TRAP: 31.2 (#4/22)&lt;/li&gt;&lt;li&gt;Truthful AI Advisors (Crawford-Sobel cheap-tal: 77.6 (#4/4)&lt;/li&gt;&lt;li&gt;AIM-Bench (inventory manager): 30.38 (#5/5)&lt;/li&gt;&lt;li&gt;Agentick: 18.7 (#6/15)&lt;/li&gt;&lt;li&gt;DVMap: 45.3 (#7/9)&lt;/li&gt;&lt;li&gt;Disentangling Language Roles in Multilingual L: 76.7 (#10/20)&lt;/li&gt;&lt;li&gt;Omni-DeepSearch: 2.19 (#10/12)&lt;/li&gt;&lt;li&gt;VerdictBench: 52.92 (#11/17)&lt;/li&gt;&lt;li&gt;CAIS Vision Capabilities Index: 47.9 (#27/35)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 4 Maverick Instruct&lt;/strong&gt; — ELO 1573, #245&lt;ul&gt;&lt;li&gt;MGSM: 92.44 (#16/67)&lt;/li&gt;&lt;li&gt;Poker Agent: 890.5 (#17/17)&lt;/li&gt;&lt;li&gt;MATH 500: 85.2 (#33/58)&lt;/li&gt;&lt;li&gt;HealthBench Hard: 32.0 (#37/55)&lt;/li&gt;&lt;li&gt;MedCode: 36.51 (#42/63)&lt;/li&gt;&lt;li&gt;MedScribe: 54.22 (#60/61)&lt;/li&gt;&lt;li&gt;EQ-Bench: 806.8 (#71/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 942.4 (#97/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Pro (002)&lt;/strong&gt; — ELO 1571, #247&lt;ul&gt;&lt;li&gt;Translation Set1 to en spBleu: 45.6 (#1/13)&lt;/li&gt;&lt;li&gt;Translation Set1 to en COMET22: 89.1 (#2/13)&lt;/li&gt;&lt;li&gt;Translation en to Set1 COMET22: 89.1 (#3/13)&lt;/li&gt;&lt;li&gt;Translation en to Set1 spBleu: 43.0 (#3/13)&lt;/li&gt;&lt;li&gt;MBPP+: 74.6 (#5/25)&lt;/li&gt;&lt;li&gt;EvalPlus: 76.95 (#11/25)&lt;/li&gt;&lt;li&gt;Defects4J: 36.4 (#11/33)&lt;/li&gt;&lt;li&gt;HumanEval+: 79.3 (#12/24)&lt;/li&gt;&lt;li&gt;MATH 500: 82.8 (#35/58)&lt;/li&gt;&lt;li&gt;MGSM: 89.2 (#46/67)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Haiku 4.5 (20251001)&lt;/strong&gt; — ELO 1569, #249&lt;ul&gt;&lt;li&gt;Arena AI Document: 1422.0 (#21/27)&lt;/li&gt;&lt;li&gt;WritingBench: 77.09 (#28/66)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Mini&lt;/strong&gt; — ELO 1568, #251&lt;ul&gt;&lt;li&gt;FullStackBench en: 64.73 (#2/31)&lt;/li&gt;&lt;li&gt;GraphARC: 58.0 (#4/11)&lt;/li&gt;&lt;li&gt;K-12EduBench: 54.46 (#19/23)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 VL 32B Instruct&lt;/strong&gt; — ELO 1566, #254&lt;ul&gt;&lt;li&gt;FIND: 77.8 (#1/9)&lt;/li&gt;&lt;li&gt;CulMind: 46.6 (#3/14)&lt;/li&gt;&lt;li&gt;TriViewBench: 61.38 (#4/19)&lt;/li&gt;&lt;li&gt;MechVQA: 76.5 (#4/17)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (en): 67.4 (#4/38)&lt;/li&gt;&lt;li&gt;OCR-Robust: 72.82 (#5/16)&lt;/li&gt;&lt;li&gt;WikiVQABench: 64.0 (#5/15)&lt;/li&gt;&lt;li&gt;EO-Gym: 59.0 (#7/11)&lt;/li&gt;&lt;li&gt;SpaceDG: 45.2 (#10/29)&lt;/li&gt;&lt;li&gt;HarmVideoBench: 79.0 (#11/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nova Premier&lt;/strong&gt; — ELO 1566, #255&lt;ul&gt;&lt;li&gt;VTB: 2.0 (#15/17)&lt;/li&gt;&lt;li&gt;AA-LCR: 30.0 (#190/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#283/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Devstral Small 2&lt;/strong&gt; — ELO 1565, #258&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 28.82 (#113/128)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 70B&lt;/strong&gt; — ELO 1564, #259&lt;ul&gt;&lt;li&gt;SAGE: 71.54 (#3/12)&lt;/li&gt;&lt;li&gt;CLEAR: 3.1 (#3/15)&lt;/li&gt;&lt;li&gt;The Wrong Kind of Right: 26.5 (#6/26)&lt;/li&gt;&lt;li&gt;StressEval: 31.7 (#6/10)&lt;/li&gt;&lt;li&gt;StreamProfileBench: 40.38 (#7/14)&lt;/li&gt;&lt;li&gt;LegalCiteBench: 64.3 (#7/21)&lt;/li&gt;&lt;li&gt;NeedleBench: 72.37 (#7/12)&lt;/li&gt;&lt;li&gt;Multi-IF: 0.83 (#9/33)&lt;/li&gt;&lt;li&gt;K-FinHallu: 70.0 (#10/12)&lt;/li&gt;&lt;li&gt;MUSE: 5.5 (#10/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.0 Flash Lite&lt;/strong&gt; — ELO 1563, #260&lt;ul&gt;&lt;li&gt;BIG-Bench Extra Hard: 8.0 (#10/20)&lt;/li&gt;&lt;li&gt;IneqMath: 1.5 (#38/42)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Pro&lt;/strong&gt; — ELO 1562, #261&lt;ul&gt;&lt;li&gt;Multi-IF: 0.76 (#4/33)&lt;/li&gt;&lt;li&gt;LLM Game Benchmark: 35.2 (#4/7)&lt;/li&gt;&lt;li&gt;MedAgentBench: 62.0 (#4/12)&lt;/li&gt;&lt;li&gt;StructEval: 71.75 (#5/12)&lt;/li&gt;&lt;li&gt;PhysicsFinals: 38.4 (#5/34)&lt;/li&gt;&lt;li&gt;AfroBench-Lite: 62.79 (#10/24)&lt;/li&gt;&lt;li&gt;K-12EduBench: 67.88 (#12/23)&lt;/li&gt;&lt;li&gt;Natural2Code: 42.3 (#13/30)&lt;/li&gt;&lt;li&gt;ACEBench: 0.73 (#18/31)&lt;/li&gt;&lt;li&gt;MedXpertQA: 26.16 (#21/26)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 32B&lt;/strong&gt; — ELO 1562, #262&lt;ul&gt;&lt;li&gt;ChaosBench-Logic v2: 47.8 (#3/10)&lt;/li&gt;&lt;li&gt;EHRBench: 64.97 (#10/31)&lt;/li&gt;&lt;li&gt;MixRea: 14.6 (#11/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Magistral Small 1.2&lt;/strong&gt; — ELO 1562, #263&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 35.19 (#108/128)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small 4&lt;/strong&gt; — ELO 1562, #264&lt;ul&gt;&lt;li&gt;BLXBench: 75.2 (#9/25)&lt;/li&gt;&lt;li&gt;ContractBench: 42.4 (#13/20)&lt;/li&gt;&lt;li&gt;StereoTales: 117.0 (#21/23)&lt;/li&gt;&lt;li&gt;ALE-Bench: 497.63 (#59/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 Preview (1106)&lt;/strong&gt; — ELO 1562, #265&lt;ul&gt;&lt;li&gt;Clembench Multimodal v1.6.5: 73.55 (#3/20)&lt;/li&gt;&lt;li&gt;Aider Refactoring Benchmark: 50.6 (#5/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 70B Instruct&lt;/strong&gt; — ELO 1561, #266&lt;ul&gt;&lt;li&gt;MathTutorBench: 55.22 (#3/8)&lt;/li&gt;&lt;li&gt;INVESTORBENCH: 38.95 (#4/14)&lt;/li&gt;&lt;li&gt;AutoLogi: 53.79 (#6/10)&lt;/li&gt;&lt;li&gt;MedGUIDE: 54.3 (#7/25)&lt;/li&gt;&lt;li&gt;AgentIF: 56.3 (#9/15)&lt;/li&gt;&lt;li&gt;Geo-Eval: 4.12 (#11/11)&lt;/li&gt;&lt;li&gt;FullStackBench en: 51.45 (#16/31)&lt;/li&gt;&lt;li&gt;ThaiSafetyBench: 24.49 (#17/24)&lt;/li&gt;&lt;li&gt;K-MetBench: 59.9 (#28/59)&lt;/li&gt;&lt;li&gt;HealthBench Hard: 29.0 (#44/55)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large 2 (Nov) Instruct (2411)&lt;/strong&gt; — ELO 1560, #268&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1720.36 (#13/108)&lt;/li&gt;&lt;li&gt;Defects4J: 25.2 (#24/33)&lt;/li&gt;&lt;li&gt;WritingBench: 54.44 (#55/66)&lt;/li&gt;&lt;li&gt;EQ-Bench: 950.7 (#65/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1090.1 (#87/123)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#264/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 5.3 (#282/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Command A&lt;/strong&gt; — ELO 1559, #270&lt;ul&gt;&lt;li&gt;Defects4J: 26.1 (#22/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Opus (20240229)&lt;/strong&gt; — ELO 1559, #271&lt;ul&gt;&lt;li&gt;RepoQA: 90.6 (#1/33)&lt;/li&gt;&lt;li&gt;ToolSandbox: 69.2 (#2/13)&lt;/li&gt;&lt;li&gt;Aider Refactoring Benchmark: 72.3 (#3/10)&lt;/li&gt;&lt;li&gt;Clembench Multimodal v1.6.5: 68.16 (#5/20)&lt;/li&gt;&lt;li&gt;HELM Safety: 96.745 (#7/57)&lt;/li&gt;&lt;li&gt;HELM Lite: 71.2737 (#19/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 32B&lt;/strong&gt; — ELO 1558, #273&lt;ul&gt;&lt;li&gt;ChLogic: 99.07 (#2/7)&lt;/li&gt;&lt;li&gt;StakeBench: 17.6 (#2/15)&lt;/li&gt;&lt;li&gt;Active Evidence-Seeking and Diagnostic Reasoni: 48.3 (#2/15)&lt;/li&gt;&lt;li&gt;ASPI: 18.7 (#3/10)&lt;/li&gt;&lt;li&gt;RedSage-Bench: 85.4 (#3/17)&lt;/li&gt;&lt;li&gt;AgentIF: 58.4 (#3/15)&lt;/li&gt;&lt;li&gt;Finetuning with Scientific Data Increases Hall: 66.0 (#4/18)&lt;/li&gt;&lt;li&gt;NRITYAM: 43.76 (#4/7)&lt;/li&gt;&lt;li&gt;Diagnosing LLM Arbitration Behavior over Pre-e: -11.5 (#4/7)&lt;/li&gt;&lt;li&gt;K-FinHallu: 77.5 (#4/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 2 (1212)&lt;/strong&gt; — ELO 1557, #276&lt;ul&gt;&lt;li&gt;MATH 500: 78.4 (#40/58)&lt;/li&gt;&lt;li&gt;MGSM: 86.15 (#58/67)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3 70B&lt;/strong&gt; — ELO 1557, #277&lt;ul&gt;&lt;li&gt;EHRBench: 63.35 (#11/31)&lt;/li&gt;&lt;li&gt;MixRea: 14.6 (#12/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 VL 8B&lt;/strong&gt; — ELO 1557, #278&lt;ul&gt;&lt;li&gt;CounterCount: 47.74 (#2/7)&lt;/li&gt;&lt;li&gt;From Hallucination to Grounding: 52.16 (#4/13)&lt;/li&gt;&lt;li&gt;AgroVG: 32.7 (#4/13)&lt;/li&gt;&lt;li&gt;LaViSA: 72.5 (#7/10)&lt;/li&gt;&lt;li&gt;Beyond Binary: 75.23 (#7/14)&lt;/li&gt;&lt;li&gt;Done, But Not Sure: 25.3 (#9/20)&lt;/li&gt;&lt;li&gt;LiveK12Bench: 79.6 (#10/12)&lt;/li&gt;&lt;li&gt;SVFSearch: 86.5 (#10/75)&lt;/li&gt;&lt;li&gt;SpatialBabel: 64.0 (#10/14)&lt;/li&gt;&lt;li&gt;EgoCoT-Bench: 65.42 (#11/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 30B A3B&lt;/strong&gt; — ELO 1556, #279&lt;ul&gt;&lt;li&gt;HalluWorld: 23.3 (#2/13)&lt;/li&gt;&lt;li&gt;PrivacyPeek: 79.95 (#5/10)&lt;/li&gt;&lt;li&gt;StakeBench: 14.0 (#6/15)&lt;/li&gt;&lt;li&gt;Forge: 76.8 (#6/21)&lt;/li&gt;&lt;li&gt;EComAgentBench: 19.5 (#7/7)&lt;/li&gt;&lt;li&gt;Prosa: 73.9 (#8/16)&lt;/li&gt;&lt;li&gt;OPT-BENCH: 54.0 (#9/19)&lt;/li&gt;&lt;li&gt;PassBench: 13.9 (#10/11)&lt;/li&gt;&lt;li&gt;LegalCiteBench: 62.8 (#10/21)&lt;/li&gt;&lt;li&gt;PinTrace: 32.85 (#10/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 Turbo&lt;/strong&gt; — ELO 1556, #280&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1781.47 (#3/108)&lt;/li&gt;&lt;li&gt;HELM Lite: 89.8402 (#4/77)&lt;/li&gt;&lt;li&gt;LLM Game Benchmark: 35.0 (#5/7)&lt;/li&gt;&lt;li&gt;MedFrameQA: 46.69 (#6/11)&lt;/li&gt;&lt;li&gt;HumanEval+: 86.6 (#6/24)&lt;/li&gt;&lt;li&gt;ComplexFuncBench: 49.5 (#7/18)&lt;/li&gt;&lt;li&gt;Aider Refactoring Benchmark: 34.1 (#8/10)&lt;/li&gt;&lt;li&gt;RepoQA: 76.4 (#10/33)&lt;/li&gt;&lt;li&gt;HELM Safety: 96.0619 (#11/57)&lt;/li&gt;&lt;li&gt;BigCodeBench-Hard: 29.1 (#13/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Command A+&lt;/strong&gt; — ELO 1556, #282&lt;ul&gt;&lt;li&gt;CharXiv-R: 52.7 (#55/60)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 37.85 (#97/128)&lt;/li&gt;&lt;li&gt;CritPt: 0.3 (#117/342)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 88.0 (#119/138)&lt;/li&gt;&lt;li&gt;AA-LCR: 46.0 (#147/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.7 Flash&lt;/strong&gt; — ELO 1555, #283&lt;ul&gt;&lt;li&gt;K12-Bench: 31.7 (#7/11)&lt;/li&gt;&lt;li&gt;VeriContest: 0.21 (#10/10)&lt;/li&gt;&lt;li&gt;POLAR-Bench: 80.0 (#12/22)&lt;/li&gt;&lt;li&gt;MUSE: 2.83 (#14/15)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1083.0 (#53/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1185.4 (#78/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;QVQ-72B-Preview&lt;/strong&gt; — ELO 1555, #285&lt;ul&gt;&lt;li&gt;MedFrameQA: 46.44 (#7/11)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;nova-2-lite-v1&lt;/strong&gt; — ELO 1554, #287&lt;ul&gt;&lt;li&gt;ALE-Bench: 236.25 (#73/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Solar Pro 3&lt;/strong&gt; — ELO 1553, #290&lt;ul&gt;&lt;li&gt;Epoch AI - Scicode: 24.65 (#123/128)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 27B (IT)&lt;/strong&gt; — ELO 1551, #291&lt;ul&gt;&lt;li&gt;Do LLMs Build World Models From Text? A Multil: 28.7 (#2/14)&lt;/li&gt;&lt;li&gt;HealthBench Hard: 59.0 (#2/55)&lt;/li&gt;&lt;li&gt;TriggerBench: 79.0 (#4/14)&lt;/li&gt;&lt;li&gt;FIND: 73.7 (#4/9)&lt;/li&gt;&lt;li&gt;Clembench Multimodal v1.6.5: 61.39 (#6/20)&lt;/li&gt;&lt;li&gt;Geo-Eval: 5.16 (#7/11)&lt;/li&gt;&lt;li&gt;GR-Ben: 34.7 (#7/22)&lt;/li&gt;&lt;li&gt;CodeGolf Bench: 20.92 (#8/9)&lt;/li&gt;&lt;li&gt;SceneFunRI: 7.6 (#9/17)&lt;/li&gt;&lt;li&gt;DentalGPT Dental Eval Suite: 51.5 (#12/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4.5V&lt;/strong&gt; — ELO 1550, #295&lt;ul&gt;&lt;li&gt;CulMind: 43.8 (#6/14)&lt;/li&gt;&lt;li&gt;StemBind: 34.6 (#8/24)&lt;/li&gt;&lt;li&gt;DentalGPT Dental Eval Suite: 54.2 (#9/16)&lt;/li&gt;&lt;li&gt;Math-VR: 49.6 (#11/31)&lt;/li&gt;&lt;li&gt;HarmVideoBench: 65.5 (#20/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 Preview (0125)&lt;/strong&gt; — ELO 1550, #296&lt;ul&gt;&lt;li&gt;ToolSandbox: 64.3 (#4/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 30B A3B 2507 Instruct&lt;/strong&gt; — ELO 1549, #297&lt;ul&gt;&lt;li&gt;Fin-RATE: 17.63 (#7/16)&lt;/li&gt;&lt;li&gt;JuICE: 33.74 (#8/10)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 63.8 (#24/44)&lt;/li&gt;&lt;li&gt;K-MetBench: 64.7 (#25/59)&lt;/li&gt;&lt;li&gt;AA-LCR: 22.7 (#213/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#307/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nova Pro (v1)&lt;/strong&gt; — ELO 1548, #300&lt;ul&gt;&lt;li&gt;FinanceArena: 20.3 (#19/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Sarvam 105B&lt;/strong&gt; — ELO 1547, #304&lt;ul&gt;&lt;li&gt;HMMT 2025: 85.8 (#42/89)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.3 70B&lt;/strong&gt; — ELO 1546, #305&lt;ul&gt;&lt;li&gt;DiagFlowBench: 85.0 (#1/10)&lt;/li&gt;&lt;li&gt;Medical Information Response Audit (MIRA): 2.95 (#1/5)&lt;/li&gt;&lt;li&gt;The Compliance Gap: 10.0 (#1/6)&lt;/li&gt;&lt;li&gt;MIRAGE: 24.0 (#2/6)&lt;/li&gt;&lt;li&gt;Truthful AI Advisors (Crawford-Sobel cheap-tal: 92.6 (#2/4)&lt;/li&gt;&lt;li&gt;CommonWhy: 21.4 (#2/7)&lt;/li&gt;&lt;li&gt;When Context Flips, Safety Breaks: 38.0 (#3/12)&lt;/li&gt;&lt;li&gt;Ukrainian Legal Text Benchmark (EDRSR subset): 81.6 (#3/7)&lt;/li&gt;&lt;li&gt;PreScam: 74.8 (#3/5)&lt;/li&gt;&lt;li&gt;EHRBench: 67.28 (#4/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.3 70B Instruct&lt;/strong&gt; — ELO 1545, #307&lt;ul&gt;&lt;li&gt;SECQUE: 65.0 (#2/7)&lt;/li&gt;&lt;li&gt;DVMap: 46.4 (#4/9)&lt;/li&gt;&lt;li&gt;PlanBench-XL: 18.96 (#5/10)&lt;/li&gt;&lt;li&gt;PrivacyPeek: 79.61 (#6/10)&lt;/li&gt;&lt;li&gt;PhiBench: 57.1 (#6/10)&lt;/li&gt;&lt;li&gt;RAGTruth: 82.6 (#6/11)&lt;/li&gt;&lt;li&gt;TraceEval: 44.3 (#7/10)&lt;/li&gt;&lt;li&gt;CombEval: 36.6 (#8/11)&lt;/li&gt;&lt;li&gt;TAEF (Text Analytics Evaluation Framework): 66.5 (#8/11)&lt;/li&gt;&lt;li&gt;Fin-RATE: 16.76 (#8/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small 3.2&lt;/strong&gt; — ELO 1545, #308&lt;ul&gt;&lt;li&gt;EQUITRIAGE: 35.0 (#5/5)&lt;/li&gt;&lt;li&gt;FINESSE-Bench: 57.51 (#28/31)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 58.1 (#33/44)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1071.6 (#57/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1242.2 (#71/123)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 26.39 (#118/128)&lt;/li&gt;&lt;li&gt;AA-LCR: 17.3 (#233/355)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 68.05 (#237/346)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#270/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 VL 8B Instruct&lt;/strong&gt; — ELO 1545, #309&lt;ul&gt;&lt;li&gt;CulMind: 48.7 (#2/14)&lt;/li&gt;&lt;li&gt;FIND: 74.1 (#2/9)&lt;/li&gt;&lt;li&gt;SocialPersona: 32.2 (#4/6)&lt;/li&gt;&lt;li&gt;TriViewBench: 60.32 (#6/19)&lt;/li&gt;&lt;li&gt;WikiVQABench: 63.1 (#6/15)&lt;/li&gt;&lt;li&gt;CFMME: 52.83 (#7/16)&lt;/li&gt;&lt;li&gt;Checkup2Action: 33.1 (#7/8)&lt;/li&gt;&lt;li&gt;Chartographer: 90.7 (#8/15)&lt;/li&gt;&lt;li&gt;WildRoadBench: 21.3 (#9/25)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (en): 65.4 (#9/38)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Medium 3&lt;/strong&gt; — ELO 1544, #311&lt;ul&gt;&lt;li&gt;Defects4J: 34.9 (#13/33)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 34.59 (#42/54)&lt;/li&gt;&lt;li&gt;AA-LCR: 28.0 (#197/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#266/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Devstral Medium&lt;/strong&gt; — ELO 1544, #313&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#160/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 28.7 (#193/355)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 70.8 (#217/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 4 Scout Instruct&lt;/strong&gt; — ELO 1543, #314&lt;ul&gt;&lt;li&gt;JuICE: 17.32 (#10/10)&lt;/li&gt;&lt;li&gt;HealthBench Hard: 32.0 (#38/55)&lt;/li&gt;&lt;li&gt;MATH 500: 79.2 (#38/58)&lt;/li&gt;&lt;li&gt;MGSM: 87.96 (#50/67)&lt;/li&gt;&lt;li&gt;WritingBench: 52.02 (#58/66)&lt;/li&gt;&lt;li&gt;MedCode: 23.31 (#61/63)&lt;/li&gt;&lt;li&gt;MedScribe: 50.59 (#61/61)&lt;/li&gt;&lt;li&gt;EQ-Bench: 608.2 (#76/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 909.0 (#98/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1 Distill Llama 70B&lt;/strong&gt; — ELO 1543, #315&lt;ul&gt;&lt;li&gt;CodeGolf Bench: 44.18 (#6/9)&lt;/li&gt;&lt;li&gt;MedAgentGym: 50.07 (#6/29)&lt;/li&gt;&lt;li&gt;AgentIF: 55.0 (#11/15)&lt;/li&gt;&lt;li&gt;HealthBench Hard: 47.0 (#13/55)&lt;/li&gt;&lt;li&gt;POLAR-Bench: 69.93 (#19/22)&lt;/li&gt;&lt;li&gt;OJBench: 16.38 (#21/44)&lt;/li&gt;&lt;li&gt;Defects4J: 22.1 (#29/33)&lt;/li&gt;&lt;li&gt;HMMT 2025: 33.33 (#78/89)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#156/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 11.0 (#258/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Magistral Medium&lt;/strong&gt; — ELO 1543, #316&lt;ul&gt;&lt;li&gt;Defects4J: 32.1 (#16/33)&lt;/li&gt;&lt;li&gt;FinanceArena: 31.8 (#17/19)&lt;/li&gt;&lt;li&gt;CritPt: 0.3 (#128/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 0.0 (#295/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hermes-4-14B&lt;/strong&gt; — ELO 1542, #317&lt;ul&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Verilator): 44.04 (#26/44)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Icarus Verilog): 42.77 (#27/44)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Icarus Verilog): 27.96 (#41/44)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Verilator): 28.99 (#41/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek V2.5&lt;/strong&gt; — ELO 1542, #319&lt;ul&gt;&lt;li&gt;FullStackBench en: 58.65 (#8/31)&lt;/li&gt;&lt;li&gt;Defects4J: 26.6 (#21/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;QwQ-32B&lt;/strong&gt; — ELO 1541, #321&lt;ul&gt;&lt;li&gt;StressEval: 34.6 (#3/10)&lt;/li&gt;&lt;li&gt;When the Manual Lies: 100.0 (#7/8)&lt;/li&gt;&lt;li&gt;Merge-Bench: 32.1 (#8/18)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Verilator): 63.75 (#11/44)&lt;/li&gt;&lt;li&gt;FinanceArena: 42.6 (#11/19)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Icarus Verilog): 62.6 (#13/44)&lt;/li&gt;&lt;li&gt;OJBench: 19.02 (#18/44)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Icarus Verilog): 40.05 (#28/44)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Verilator): 41.14 (#28/44)&lt;/li&gt;&lt;li&gt;WritingBench: 72.4 (#41/66)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 4 Scout&lt;/strong&gt; — ELO 1540, #323&lt;ul&gt;&lt;li&gt;PinTrace: 38.59 (#7/10)&lt;/li&gt;&lt;li&gt;CodeGolf Bench: 16.65 (#9/9)&lt;/li&gt;&lt;li&gt;TableVista: 49.4 (#9/29)&lt;/li&gt;&lt;li&gt;Qiskit QuantumKatas: 34.3 (#15/16)&lt;/li&gt;&lt;li&gt;VTB: 1.58 (#16/17)&lt;/li&gt;&lt;li&gt;PerfCodeBench: 19.6 (#20/20)&lt;/li&gt;&lt;li&gt;MedLayXPlain: 51.1 (#23/32)&lt;/li&gt;&lt;li&gt;IneqMath: 1.5 (#37/42)&lt;/li&gt;&lt;li&gt;ZeroBench: 3.0 (#46/69)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1500.45 (#66/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nova Pro&lt;/strong&gt; — ELO 1540, #324&lt;ul&gt;&lt;li&gt;Translation en to Set1 spBleu: 43.4 (#1/13)&lt;/li&gt;&lt;li&gt;VIBench: 12.2 (#2/10)&lt;/li&gt;&lt;li&gt;Ukrainian Legal Text Benchmark (EDRSR subset): 82.7 (#2/7)&lt;/li&gt;&lt;li&gt;Translation Set1 to en spBleu: 44.4 (#2/13)&lt;/li&gt;&lt;li&gt;Translation en to Set1 COMET22: 89.1 (#4/13)&lt;/li&gt;&lt;li&gt;Translation Set1 to en COMET22: 89.0 (#4/13)&lt;/li&gt;&lt;li&gt;LVBench: 41.6 (#33/49)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 26.27 (#49/54)&lt;/li&gt;&lt;li&gt;AA-LCR: 19.0 (#228/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#284/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 14B&lt;/strong&gt; — ELO 1539, #325&lt;ul&gt;&lt;li&gt;ChLogic: 99.13 (#1/7)&lt;/li&gt;&lt;li&gt;AgingBench: 7.9 (#1/8)&lt;/li&gt;&lt;li&gt;LegalCiteBench: 71.6 (#2/21)&lt;/li&gt;&lt;li&gt;StakeBench: 17.3 (#4/15)&lt;/li&gt;&lt;li&gt;TRACER: 72.0 (#4/4)&lt;/li&gt;&lt;li&gt;Active Evidence-Seeking and Diagnostic Reasoni: 45.1 (#4/15)&lt;/li&gt;&lt;li&gt;GraphARC: 37.0 (#5/11)&lt;/li&gt;&lt;li&gt;K-FinHallu: 75.6 (#5/12)&lt;/li&gt;&lt;li&gt;StreamProfileBench: 41.33 (#5/14)&lt;/li&gt;&lt;li&gt;CULTURE-MT: 41.32 (#6/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.2 90B Vision Instruct&lt;/strong&gt; — ELO 1539, #326&lt;ul&gt;&lt;li&gt;MineExplorer: 9.96 (#16/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 4B&lt;/strong&gt; — ELO 1539, #327&lt;ul&gt;&lt;li&gt;MCJudgeBench: 85.3 (#3/7)&lt;/li&gt;&lt;li&gt;SceneFunRI: 10.99 (#6/17)&lt;/li&gt;&lt;li&gt;CodeClinic: 21.0 (#7/8)&lt;/li&gt;&lt;li&gt;Benchmarking Large Language Models for Graphem: 43.98 (#8/37)&lt;/li&gt;&lt;li&gt;SVFSearch: 87.9 (#8/75)&lt;/li&gt;&lt;li&gt;TeleResilienceBench: 16.9 (#8/8)&lt;/li&gt;&lt;li&gt;SAGE: 60.5 (#9/12)&lt;/li&gt;&lt;li&gt;StemBind: 33.8 (#10/24)&lt;/li&gt;&lt;li&gt;Are LLMs Ready to Assist Physicians? PhysAssis: 48.7 (#14/14)&lt;/li&gt;&lt;li&gt;MMGist: 42.0 (#16/27)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 Nemotron 70B Instruct&lt;/strong&gt; — ELO 1539, #328&lt;ul&gt;&lt;li&gt;HealthBench Hard: 41.0 (#22/55)&lt;/li&gt;&lt;li&gt;Defects4J: 22.8 (#27/33)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#243/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 7.0 (#271/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 VL 72B Instruct&lt;/strong&gt; — ELO 1539, #329&lt;ul&gt;&lt;li&gt;MedFrameQA: 42.65 (#10/11)&lt;/li&gt;&lt;li&gt;VideoMME w/o sub.: 73.3 (#11/61)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (en): 61.5 (#19/38)&lt;/li&gt;&lt;li&gt;K-MetBench: 67.1 (#22/59)&lt;/li&gt;&lt;li&gt;ScreenSpot-Pro: 53.3 (#27/34)&lt;/li&gt;&lt;li&gt;LVBench: 47.3 (#29/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Pixtral Large&lt;/strong&gt; — ELO 1539, #330&lt;ul&gt;&lt;li&gt;ZEROBench-Sub: 18.68 (#32/45)&lt;/li&gt;&lt;li&gt;AA-LCR: 10.3 (#261/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Flash (001)&lt;/strong&gt; — ELO 1536, #334&lt;ul&gt;&lt;li&gt;HELM Lite: 71.6184 (#18/77)&lt;/li&gt;&lt;li&gt;HELM Safety: 92.7331 (#23/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-OSS-20B&lt;/strong&gt; — ELO 1535, #336&lt;ul&gt;&lt;li&gt;CombEval: 59.4 (#5/11)&lt;/li&gt;&lt;li&gt;Fin-RATE: 18.69 (#5/16)&lt;/li&gt;&lt;li&gt;PDP-Bench: 57.23 (#7/7)&lt;/li&gt;&lt;li&gt;Managing Procedural Memory in LLM Agents: 2.0 (#8/13)&lt;/li&gt;&lt;li&gt;Decomposing and Measuring Evaluation Awareness: 0.2 (#9/9)&lt;/li&gt;&lt;li&gt;Large Language Models Lack Temporal Awareness: 54.05 (#9/14)&lt;/li&gt;&lt;li&gt;AgentFloor: 42.9 (#9/17)&lt;/li&gt;&lt;li&gt;Qiskit QuantumKatas: 59.7 (#10/16)&lt;/li&gt;&lt;li&gt;MATH 500: 94.2 (#10/58)&lt;/li&gt;&lt;li&gt;StreamProfileBench: 34.68 (#11/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;InternVL3-8B&lt;/strong&gt; — ELO 1534, #339&lt;ul&gt;&lt;li&gt;MedLayXPlain: 64.7 (#5/32)&lt;/li&gt;&lt;li&gt;On the Cultural Anachronism and Temporal Reaso: 36.2 (#6/11)&lt;/li&gt;&lt;li&gt;CulMind: 42.8 (#7/14)&lt;/li&gt;&lt;li&gt;Seeing Isn't Knowing: 47.5 (#8/9)&lt;/li&gt;&lt;li&gt;Chartographer: 84.7 (#12/15)&lt;/li&gt;&lt;li&gt;SceneFunRI: 4.09 (#12/17)&lt;/li&gt;&lt;li&gt;SpatialBabel: 54.1 (#14/14)&lt;/li&gt;&lt;li&gt;WildRoadBench: 10.9 (#19/25)&lt;/li&gt;&lt;li&gt;C3-Bench: 4.1 (#21/33)&lt;/li&gt;&lt;li&gt;SpaceDG: 40.1 (#21/29)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Opus&lt;/strong&gt; — ELO 1534, #341&lt;ul&gt;&lt;li&gt;OSWorld: 83.39 (#4/66)&lt;/li&gt;&lt;li&gt;MBPP+: 73.3 (#9/25)&lt;/li&gt;&lt;li&gt;Natural2Code: 48.3 (#10/30)&lt;/li&gt;&lt;li&gt;EvalPlus: 75.35 (#12/25)&lt;/li&gt;&lt;li&gt;HumanEval+: 77.4 (#16/24)&lt;/li&gt;&lt;li&gt;SVFSearch: 69.0 (#21/75)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small 3.1&lt;/strong&gt; — ELO 1530, #343&lt;ul&gt;&lt;li&gt;Polaris-Bench: 19.4 (#14/15)&lt;/li&gt;&lt;li&gt;Defects4J: 22.5 (#28/33)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1484.82 (#70/108)&lt;/li&gt;&lt;li&gt;EQ-Bench: 783.6 (#74/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 867.9 (#102/123)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 26.5 (#117/128)&lt;/li&gt;&lt;li&gt;AA-LCR: 19.7 (#226/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#269/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4&lt;/strong&gt; — ELO 1530, #344&lt;ul&gt;&lt;li&gt;CyberSecEval: 19.87 (#2/7)&lt;/li&gt;&lt;li&gt;Open FinLLM Leaderboard: 48.34 (#2/25)&lt;/li&gt;&lt;li&gt;HumanEval+: 79.3 (#13/24)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 VL 30B A3B Instruct&lt;/strong&gt; — ELO 1529, #345&lt;ul&gt;&lt;li&gt;MechVQA: 64.47 (#9/17)&lt;/li&gt;&lt;li&gt;WritingBench: 82.6 (#12/66)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (en): 63.2 (#14/38)&lt;/li&gt;&lt;li&gt;HarmVideoBench: 76.3 (#15/21)&lt;/li&gt;&lt;li&gt;Multi-IF: 66.1 (#16/33)&lt;/li&gt;&lt;li&gt;LVBench: 62.5 (#19/49)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (zh): 57.8 (#24/37)&lt;/li&gt;&lt;li&gt;K-MetBench: 62.2 (#26/59)&lt;/li&gt;&lt;li&gt;CharXiv-R: 48.9 (#57/60)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 84.6 (#119/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ling-2.6-flash&lt;/strong&gt; — ELO 1529, #346&lt;ul&gt;&lt;li&gt;AA-LCR: 25.0 (#204/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#235/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;gemma-4-E4B-it&lt;/strong&gt; — ELO 1528, #347&lt;ul&gt;&lt;li&gt;SciPaths: 6.1 (#6/10)&lt;/li&gt;&lt;li&gt;Chartographer: 86.0 (#11/15)&lt;/li&gt;&lt;li&gt;MT-JailBench: 78.62 (#11/21)&lt;/li&gt;&lt;li&gt;StemBind: 30.6 (#15/24)&lt;/li&gt;&lt;li&gt;TableVista: 27.0 (#24/29)&lt;/li&gt;&lt;li&gt;EnterpriseArena: 0.0 (#26/27)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small 3&lt;/strong&gt; — ELO 1528, #348&lt;ul&gt;&lt;li&gt;TRLawBench: 62.5 (#21/32)&lt;/li&gt;&lt;li&gt;EQ-Bench: 801.7 (#72/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 833.2 (#107/123)&lt;/li&gt;&lt;li&gt;AA-LCR: 0.0 (#324/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mixtral 8x22B Instruct&lt;/strong&gt; — ELO 1525, #351&lt;ul&gt;&lt;li&gt;ENAMEL: 40.8 (#5/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Large&lt;/strong&gt; — ELO 1525, #352&lt;ul&gt;&lt;li&gt;LinAlg-Bench: 98.2 (#5/10)&lt;/li&gt;&lt;li&gt;AgentLeak: 99.3 (#5/5)&lt;/li&gt;&lt;li&gt;DiagnosticIQ: 63.15 (#13/33)&lt;/li&gt;&lt;li&gt;HELM Lite: 36.8548 (#52/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Flash (002)&lt;/strong&gt; — ELO 1524, #353&lt;ul&gt;&lt;li&gt;Translation Set1 to en COMET22: 88.8 (#5/13)&lt;/li&gt;&lt;li&gt;Translation Set1 to en spBleu: 42.9 (#7/13)&lt;/li&gt;&lt;li&gt;Translation en to Set1 COMET22: 88.5 (#8/13)&lt;/li&gt;&lt;li&gt;Translation en to Set1 spBleu: 40.0 (#9/13)&lt;/li&gt;&lt;li&gt;EvalPlus: 71.55 (#17/25)&lt;/li&gt;&lt;li&gt;HumanEval+: 75.6 (#17/24)&lt;/li&gt;&lt;li&gt;MBPP+: 67.5 (#23/25)&lt;/li&gt;&lt;li&gt;MATH 500: 78.8 (#39/58)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 34.03 (#43/54)&lt;/li&gt;&lt;li&gt;MGSM: 86.58 (#55/67)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral 3 14B&lt;/strong&gt; — ELO 1524, #354&lt;ul&gt;&lt;li&gt;P3B3: 90.7 (#7/20)&lt;/li&gt;&lt;li&gt;POLAR-Bench: 71.96 (#16/22)&lt;/li&gt;&lt;li&gt;ContractBench: 28.3 (#16/20)&lt;/li&gt;&lt;li&gt;AgentFloor: 18.8 (#16/17)&lt;/li&gt;&lt;li&gt;BacktestBench: 26.98 (#17/23)&lt;/li&gt;&lt;li&gt;Mirror, Mirror on the Wall: 33.0 (#27/43)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (zh): 44.0 (#35/37)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (en): 43.3 (#36/38)&lt;/li&gt;&lt;li&gt;AA-LCR: 22.0 (#215/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Flash&lt;/strong&gt; — ELO 1524, #355&lt;ul&gt;&lt;li&gt;PhysicsFinals: 57.4 (#2/34)&lt;/li&gt;&lt;li&gt;Multi-IF: 0.72 (#2/33)&lt;/li&gt;&lt;li&gt;Natural2Code: 79.8 (#4/30)&lt;/li&gt;&lt;li&gt;LLM Game Benchmark: 32.5 (#6/7)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Haiku&lt;/strong&gt; — ELO 1524, #356&lt;ul&gt;&lt;li&gt;Fin-Bias: 97.1 (#6/19)&lt;/li&gt;&lt;li&gt;ComplexFuncBench: 45.8 (#9/18)&lt;/li&gt;&lt;li&gt;K-12EduBench: 44.98 (#21/23)&lt;/li&gt;&lt;li&gt;DiagnosticIQ: 46.93 (#30/33)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 27.43 (#116/128)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mixtral 8x22B Instruct (v0.1)&lt;/strong&gt; — ELO 1523, #358&lt;ul&gt;&lt;li&gt;RepoQA: 67.8 (#12/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 (0613)&lt;/strong&gt; — ELO 1522, #362&lt;ul&gt;&lt;li&gt;ENAMEL: 45.4 (#3/31)&lt;/li&gt;&lt;li&gt;HELM Lite: 90.8908 (#3/77)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1747.59 (#8/108)&lt;/li&gt;&lt;li&gt;Inverse Turing Bench: 48.29 (#19/24)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 4.0 (#139/153)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen3 Omni 30B A3B Instruct&lt;/strong&gt; — ELO 1522, #363&lt;ul&gt;&lt;li&gt;Omni-DeepSearch: 3.44 (#9/12)&lt;/li&gt;&lt;li&gt;OCRBench v2: 61.3 (#10/29)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (zh): 60.0 (#15/37)&lt;/li&gt;&lt;li&gt;AudioMC: 24.34 (#16/31)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (en): 61.3 (#20/38)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 Coder 32B Instruct&lt;/strong&gt; — ELO 1521, #365&lt;ul&gt;&lt;li&gt;EvalPlus: 82.1 (#3/25)&lt;/li&gt;&lt;li&gt;MBPP+: 77.0 (#3/25)&lt;/li&gt;&lt;li&gt;HumanEval+: 87.2 (#3/24)&lt;/li&gt;&lt;li&gt;TraceEval: 46.6 (#6/10)&lt;/li&gt;&lt;li&gt;TuRTLe Module Completion (NotSoTiny): 11.85 (#11/15)&lt;/li&gt;&lt;li&gt;FullStackBench en: 56.88 (#12/31)&lt;/li&gt;&lt;li&gt;BigCodeBench-Hard: 27.7 (#19/20)&lt;/li&gt;&lt;li&gt;Defects4J: 27.1 (#20/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;nemotron-3-nano-30B-a3B&lt;/strong&gt; — ELO 1521, #366&lt;ul&gt;&lt;li&gt;TW-LegalBench: 52.6 (#9/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Mini (2024-09-12)&lt;/strong&gt; — ELO 1521, #367&lt;ul&gt;&lt;li&gt;EvalPlus: 83.9 (#2/25)&lt;/li&gt;&lt;li&gt;MBPP+: 78.8 (#2/25)&lt;/li&gt;&lt;li&gt;HumanEval+: 89.0 (#2/24)&lt;/li&gt;&lt;li&gt;HELM Safety: 95.5323 (#12/57)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1626.65 (#29/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3 70B Instruct&lt;/strong&gt; — ELO 1520, #368&lt;ul&gt;&lt;li&gt;CyberSecEval: 29.27 (#3/7)&lt;/li&gt;&lt;li&gt;AgentClinic: 19.0 (#6/7)&lt;/li&gt;&lt;li&gt;RepoQA: 82.2 (#7/33)&lt;/li&gt;&lt;li&gt;Open FinLLM Leaderboard: 31.23 (#7/25)&lt;/li&gt;&lt;li&gt;C4STYLI: 62.4 (#12/18)&lt;/li&gt;&lt;li&gt;MBPP+: 69.0 (#19/25)&lt;/li&gt;&lt;li&gt;EvalPlus: 70.5 (#20/25)&lt;/li&gt;&lt;li&gt;HealthBench Hard: 41.0 (#21/55)&lt;/li&gt;&lt;li&gt;HumanEval+: 72.0 (#23/24)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#238/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;EXAONE 4.0 32B&lt;/strong&gt; — ELO 1520, #369&lt;ul&gt;&lt;li&gt;K-FinHallu: 71.7 (#8/12)&lt;/li&gt;&lt;li&gt;K-MetBench: 59.9 (#29/59)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;aya-expanse-32B&lt;/strong&gt; — ELO 1519, #370&lt;ul&gt;&lt;li&gt;CommunityFact: 69.93 (#5/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 27B&lt;/strong&gt; — ELO 1517, #371&lt;ul&gt;&lt;li&gt;NeedleBench: 80.38 (#2/12)&lt;/li&gt;&lt;li&gt;Natural2Code: 84.5 (#2/30)&lt;/li&gt;&lt;li&gt;SAGE: 66.17 (#5/12)&lt;/li&gt;&lt;li&gt;MixRea: 16.2 (#6/21)&lt;/li&gt;&lt;li&gt;CounterCount: 36.96 (#6/7)&lt;/li&gt;&lt;li&gt;MolDeTox: 1.55 (#6/15)&lt;/li&gt;&lt;li&gt;ECLeKTic: 16.7 (#6/14)&lt;/li&gt;&lt;li&gt;TukaBench: 15.6 (#7/13)&lt;/li&gt;&lt;li&gt;CardioLens: 51.77 (#7/24)&lt;/li&gt;&lt;li&gt;When Context Flips, Safety Breaks: 27.8 (#7/12)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;QwQ 32B-Preview&lt;/strong&gt; — ELO 1516, #374&lt;ul&gt;&lt;li&gt;VRBench: 35.9 (#28/29)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 VL 4B&lt;/strong&gt; — ELO 1513, #375&lt;ul&gt;&lt;li&gt;TRAP: 40.4 (#1/22)&lt;/li&gt;&lt;li&gt;LaViSA: 78.2 (#5/10)&lt;/li&gt;&lt;li&gt;Done, But Not Sure: 25.6 (#8/20)&lt;/li&gt;&lt;li&gt;SVFSearch: 84.6 (#12/75)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral 3 8B&lt;/strong&gt; — ELO 1512, #377&lt;ul&gt;&lt;li&gt;AgentFloor: 55.2 (#3/17)&lt;/li&gt;&lt;li&gt;POLAR-Bench: 76.12 (#14/22)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 (0314)&lt;/strong&gt; — ELO 1512, #378&lt;ul&gt;&lt;li&gt;EQ-Bench: 577.6 (#77/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 875.4 (#101/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o Mini&lt;/strong&gt; — ELO 1511, #379&lt;ul&gt;&lt;li&gt;MASLegalBench: 84.32 (#2/5)&lt;/li&gt;&lt;li&gt;Finetuning with Scientific Data Increases Hall: 66.1 (#3/18)&lt;/li&gt;&lt;li&gt;On Stable Long-Form Generation: 33.9 (#3/13)&lt;/li&gt;&lt;li&gt;LaborBench: 67.0 (#3/5)&lt;/li&gt;&lt;li&gt;DVMap: 46.3 (#5/9)&lt;/li&gt;&lt;li&gt;PhiBench: 58.7 (#5/10)&lt;/li&gt;&lt;li&gt;DiagFlowBench: 75.4 (#6/10)&lt;/li&gt;&lt;li&gt;ATC Safety-Oriented Language Understanding Eval: 44.83 (#6/11)&lt;/li&gt;&lt;li&gt;Beyond Continuity: 64.5 (#6/10)&lt;/li&gt;&lt;li&gt;Translation en to Set1 COMET22: 88.7 (#6/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4o Mini (2024-07-18)&lt;/strong&gt; — ELO 1511, #380&lt;ul&gt;&lt;li&gt;Clembench Multimodal v1.6.5: 58.46 (#7/20)&lt;/li&gt;&lt;li&gt;MedHELM: 39.2857 (#7/9)&lt;/li&gt;&lt;li&gt;HumanEval+: 83.5 (#8/24)&lt;/li&gt;&lt;li&gt;EvalPlus: 77.85 (#9/25)&lt;/li&gt;&lt;li&gt;Generate README Eval: 32.16 (#11/14)&lt;/li&gt;&lt;li&gt;MBPP+: 72.2 (#12/25)&lt;/li&gt;&lt;li&gt;HELM MedQA: 74.9503 (#13/13)&lt;/li&gt;&lt;li&gt;Balrog: 17.4 (#14/16)&lt;/li&gt;&lt;li&gt;HELM Lite: 75.6818 (#14/77)&lt;/li&gt;&lt;li&gt;ACEBench: 0.76 (#19/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Reka Flash 3&lt;/strong&gt; — ELO 1511, #381&lt;ul&gt;&lt;li&gt;Creative Writing v3: 1244.5 (#70/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Jamba 1.7 Large&lt;/strong&gt; — ELO 1511, #383&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#212/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 17.3 (#232/355)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 57.65 (#276/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 12B (IT)&lt;/strong&gt; — ELO 1510, #385&lt;ul&gt;&lt;li&gt;FIND: 71.7 (#5/9)&lt;/li&gt;&lt;li&gt;ALARB: 29.6 (#5/12)&lt;/li&gt;&lt;li&gt;Human-Grounded Multimodal Benchmark with 900K: 54.5 (#8/11)&lt;/li&gt;&lt;li&gt;TriBench-Ko: 62.9 (#8/13)&lt;/li&gt;&lt;li&gt;GeoRC: 31.21 (#11/15)&lt;/li&gt;&lt;li&gt;SceneFunRI: 4.09 (#13/17)&lt;/li&gt;&lt;li&gt;GR-Ben: 25.2 (#14/22)&lt;/li&gt;&lt;li&gt;ThaiSafetyBench: 20.4 (#15/24)&lt;/li&gt;&lt;li&gt;FAM-Bench: 71.8 (#17/21)&lt;/li&gt;&lt;li&gt;C4STYLI: 54.7 (#17/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nova Micro&lt;/strong&gt; — ELO 1510, #387&lt;ul&gt;&lt;li&gt;Translation en to Set1 spBleu: 40.2 (#7/13)&lt;/li&gt;&lt;li&gt;Translation Set1 to en COMET22: 88.7 (#8/13)&lt;/li&gt;&lt;li&gt;Translation Set1 to en spBleu: 42.6 (#8/13)&lt;/li&gt;&lt;li&gt;Translation en to Set1 COMET22: 88.5 (#9/13)&lt;/li&gt;&lt;li&gt;AA-LCR: 9.7 (#263/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#282/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-4&lt;/strong&gt; — ELO 1508, #388&lt;ul&gt;&lt;li&gt;Diagnosing LLM Arbitration Behavior over Pre-e: -0.4 (#3/7)&lt;/li&gt;&lt;li&gt;NRITYAM: 40.36 (#5/7)&lt;/li&gt;&lt;li&gt;SECQUE: 56.0 (#5/7)&lt;/li&gt;&lt;li&gt;BLUEX v2: 7.09 (#6/10)&lt;/li&gt;&lt;li&gt;TriBench-Ko: 71.2 (#6/13)&lt;/li&gt;&lt;li&gt;PhiBench: 56.2 (#7/10)&lt;/li&gt;&lt;li&gt;Halluverse-M3: 70.38 (#8/14)&lt;/li&gt;&lt;li&gt;PhysicsFinals: 29.1 (#10/34)&lt;/li&gt;&lt;li&gt;BBH: 59.4 (#10/16)&lt;/li&gt;&lt;li&gt;PersonaArena: 3.49 (#11/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 2 27B (IT)&lt;/strong&gt; — ELO 1508, #389&lt;ul&gt;&lt;li&gt;Fin-Bias: 97.5 (#5/19)&lt;/li&gt;&lt;li&gt;Open FinLLM Leaderboard: 19.81 (#14/25)&lt;/li&gt;&lt;li&gt;BIG-Bench Extra Hard: 4.0 (#17/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Granite 4.1 8B&lt;/strong&gt; — ELO 1507, #391&lt;ul&gt;&lt;li&gt;BLXBench: 64.6 (#12/25)&lt;/li&gt;&lt;li&gt;Qiskit QuantumKatas: 32.3 (#16/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 1.5 72B Chat&lt;/strong&gt; — ELO 1505, #394&lt;ul&gt;&lt;li&gt;RepoQA: 67.0 (#13/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 VL 32B Instruct&lt;/strong&gt; — ELO 1503, #396&lt;ul&gt;&lt;li&gt;VideoMME w sub.: 77.9 (#16/65)&lt;/li&gt;&lt;li&gt;VideoMME w/o sub.: 70.5 (#19/61)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (zh): 59.1 (#20/37)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (en): 57.2 (#26/38)&lt;/li&gt;&lt;li&gt;LVBench: 49.0 (#26/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 8B&lt;/strong&gt; — ELO 1499, #400&lt;ul&gt;&lt;li&gt;Benchmarking Large Language Models for Graphem: 100.15 (#1/37)&lt;/li&gt;&lt;li&gt;Finetuning with Scientific Data Increases Hall: 67.1 (#1/18)&lt;/li&gt;&lt;li&gt;When Lower Privileges Suffice: 64.9 (#1/11)&lt;/li&gt;&lt;li&gt;ProtStructQA: 68.05 (#2/4)&lt;/li&gt;&lt;li&gt;Fin-Bias: 98.3 (#2/19)&lt;/li&gt;&lt;li&gt;ChLogic: 98.4 (#3/7)&lt;/li&gt;&lt;li&gt;MedCTA: 27.8 (#4/18)&lt;/li&gt;&lt;li&gt;AgingBench: 6.2 (#4/8)&lt;/li&gt;&lt;li&gt;CULTURE-MT: 49.6 (#4/15)&lt;/li&gt;&lt;li&gt;Pseudo-Deliberation in Language Models: 44.2 (#4/4)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Magistral Small&lt;/strong&gt; — ELO 1498, #403&lt;ul&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Icarus Verilog): 40.82 (#28/44)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Verilator): 41.02 (#28/44)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Icarus Verilog): 22.62 (#44/44)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Verilator): 23.47 (#44/44)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 74.63 (#184/346)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#254/342)&lt;/li&gt;&lt;li&gt;Epoch AI - ECI: 132.91 (#336/463)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 12B&lt;/strong&gt; — ELO 1493, #409&lt;ul&gt;&lt;li&gt;Natural2Code: 80.7 (#3/30)&lt;/li&gt;&lt;li&gt;MixRea: 18.2 (#4/21)&lt;/li&gt;&lt;li&gt;CounterCount: 40.22 (#5/7)&lt;/li&gt;&lt;li&gt;NeedleBench: 75.31 (#5/12)&lt;/li&gt;&lt;li&gt;P3B3: 92.9 (#6/20)&lt;/li&gt;&lt;li&gt;Relevance as a Vulnerability: 2.46 (#6/8)&lt;/li&gt;&lt;li&gt;The Age of Curiosity Meets the Age of AI: Benc: 4.83 (#6/13)&lt;/li&gt;&lt;li&gt;SAGE: 64.5 (#7/12)&lt;/li&gt;&lt;li&gt;ECLeKTic: 10.3 (#7/14)&lt;/li&gt;&lt;li&gt;FullHome: 37.0 (#8/8)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1 Distill Qwen 32B&lt;/strong&gt; — ELO 1493, #410&lt;ul&gt;&lt;li&gt;MedAgentGym: 47.05 (#9/29)&lt;/li&gt;&lt;li&gt;POLAR-Bench: 81.19 (#10/22)&lt;/li&gt;&lt;li&gt;AgentIF: 55.1 (#10/15)&lt;/li&gt;&lt;li&gt;Active Evidence-Seeking and Diagnostic Reasoni: 33.9 (#11/15)&lt;/li&gt;&lt;li&gt;HealthBench Hard: 44.0 (#15/55)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 68.9 (#18/44)&lt;/li&gt;&lt;li&gt;OJBench: 17.83 (#20/44)&lt;/li&gt;&lt;li&gt;PhysicsFinals: 6.8 (#27/34)&lt;/li&gt;&lt;li&gt;Defects4J: 21.4 (#30/33)&lt;/li&gt;&lt;li&gt;HMMT 2025: 33.33 (#77/89)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3.5 Haiku (20241022)&lt;/strong&gt; — ELO 1493, #413&lt;ul&gt;&lt;li&gt;MedGUIDE: 47.5 (#14/25)&lt;/li&gt;&lt;li&gt;MATH 500: 64.2 (#55/58)&lt;/li&gt;&lt;li&gt;WritingBench: 49.06 (#60/66)&lt;/li&gt;&lt;li&gt;MGSM: 84.62 (#61/67)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1178.6 (#82/123)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1413.9 (#85/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 2 27B&lt;/strong&gt; — ELO 1492, #415&lt;ul&gt;&lt;li&gt;MixRea: 14.3 (#14/21)&lt;/li&gt;&lt;li&gt;AfroBench-Lite: 44.87 (#14/24)&lt;/li&gt;&lt;li&gt;Benchmarking Large Language Models for Graphem: 24.56 (#16/37)&lt;/li&gt;&lt;li&gt;PhysicsFinals: 18.3 (#16/34)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1 0528 Qwen3 8B&lt;/strong&gt; — ELO 1492, #416&lt;ul&gt;&lt;li&gt;AA MMLU-Pro: 73.88 (#196/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;gemma-4-E2B-it&lt;/strong&gt; — ELO 1488, #420&lt;ul&gt;&lt;li&gt;StemBind: 28.6 (#18/24)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Nova Lite&lt;/strong&gt; — ELO 1488, #422&lt;ul&gt;&lt;li&gt;Translation en to Set1 COMET22: 88.8 (#5/13)&lt;/li&gt;&lt;li&gt;Translation en to Set1 spBleu: 41.5 (#5/13)&lt;/li&gt;&lt;li&gt;Translation Set1 to en COMET22: 88.8 (#6/13)&lt;/li&gt;&lt;li&gt;Translation Set1 to en spBleu: 43.1 (#6/13)&lt;/li&gt;&lt;li&gt;LVBench: 40.4 (#36/49)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 25.5 (#51/54)&lt;/li&gt;&lt;li&gt;AA-LCR: 17.7 (#231/355)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#281/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Sarvam 30B&lt;/strong&gt; — ELO 1488, #424&lt;ul&gt;&lt;li&gt;HMMT 2025: 73.3 (#59/89)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 1.5 32B Chat&lt;/strong&gt; — ELO 1487, #425&lt;ul&gt;&lt;li&gt;RepoQA: 33.8 (#25/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 7B&lt;/strong&gt; — ELO 1484, #427&lt;ul&gt;&lt;li&gt;Relevance as a Vulnerability: 3.45 (#1/8)&lt;/li&gt;&lt;li&gt;LexGenius: 59.38 (#3/9)&lt;/li&gt;&lt;li&gt;Benchmarking Large Language Models for Graphem: 79.39 (#4/37)&lt;/li&gt;&lt;li&gt;Large Language Models Lack Temporal Awareness: 59.64 (#4/14)&lt;/li&gt;&lt;li&gt;ERGeoBench: 2.24 (#6/9)&lt;/li&gt;&lt;li&gt;MHGraphBench: 43.61 (#7/15)&lt;/li&gt;&lt;li&gt;StatABench: 38.1 (#8/9)&lt;/li&gt;&lt;li&gt;On Stable Long-Form Generation: 17.0 (#9/13)&lt;/li&gt;&lt;li&gt;TW-LegalBench: 49.7 (#10/13)&lt;/li&gt;&lt;li&gt;MixRea: 15.0 (#10/21)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 VL 4B Instruct&lt;/strong&gt; — ELO 1481, #432&lt;ul&gt;&lt;li&gt;FIND: 69.6 (#6/9)&lt;/li&gt;&lt;li&gt;TriViewBench: 52.0 (#7/19)&lt;/li&gt;&lt;li&gt;WikiVQABench: 60.2 (#7/15)&lt;/li&gt;&lt;li&gt;EO-Gym: 49.0 (#9/11)&lt;/li&gt;&lt;li&gt;MechVQA: 60.23 (#12/17)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (en): 63.7 (#12/38)&lt;/li&gt;&lt;li&gt;WritingBench: 82.5 (#13/66)&lt;/li&gt;&lt;li&gt;OCR-Robust: 49.79 (#16/16)&lt;/li&gt;&lt;li&gt;SpaceDG: 39.7 (#22/29)&lt;/li&gt;&lt;li&gt;LVBench: 56.2 (#22/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LFM2 24B A2B&lt;/strong&gt; — ELO 1481, #433&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#229/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 0.0 (#314/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;InternVL3.5-8B&lt;/strong&gt; — ELO 1480, #436&lt;ul&gt;&lt;li&gt;AgroVG: 39.6 (#2/13)&lt;/li&gt;&lt;li&gt;CardioLens: 52.51 (#5/24)&lt;/li&gt;&lt;li&gt;From Hallucination to Grounding: 43.59 (#9/13)&lt;/li&gt;&lt;li&gt;OCR-Robust: 57.26 (#10/16)&lt;/li&gt;&lt;li&gt;MechVQA: 49.82 (#14/17)&lt;/li&gt;&lt;li&gt;EgoCoT-Bench: 64.06 (#14/20)&lt;/li&gt;&lt;li&gt;CC-OCR V2: 47.83 (#14/15)&lt;/li&gt;&lt;li&gt;TriViewBench: 36.34 (#15/19)&lt;/li&gt;&lt;li&gt;MedLayXPlain: 58.7 (#15/32)&lt;/li&gt;&lt;li&gt;DiffCap-Bench: 51.9 (#16/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4.1 Nano&lt;/strong&gt; — ELO 1477, #438&lt;ul&gt;&lt;li&gt;EQUITRIAGE: 37.4 (#2/5)&lt;/li&gt;&lt;li&gt;LexGenius: 53.43 (#5/9)&lt;/li&gt;&lt;li&gt;GraphARC: 12.0 (#8/11)&lt;/li&gt;&lt;li&gt;The Metanym Game: 3.22 (#10/12)&lt;/li&gt;&lt;li&gt;ComplexFuncBench: 5.7 (#14/18)&lt;/li&gt;&lt;li&gt;Multi-IF: 57.2 (#15/33)&lt;/li&gt;&lt;li&gt;EHRBench: 60.48 (#16/31)&lt;/li&gt;&lt;li&gt;BigCodeBench-Hard: 28.4 (#17/20)&lt;/li&gt;&lt;li&gt;RefusalBench: 0.2 (#18/19)&lt;/li&gt;&lt;li&gt;HELM Safety: 93.765 (#18/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4 9B Chat&lt;/strong&gt; — ELO 1477, #439&lt;ul&gt;&lt;li&gt;Fin-Bias: 98.1 (#3/19)&lt;/li&gt;&lt;li&gt;NeedleBench: 66.51 (#11/12)&lt;/li&gt;&lt;li&gt;AsyncTool: 6.88 (#15/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Hunyuan A13B-Instruct&lt;/strong&gt; — ELO 1476, #440&lt;ul&gt;&lt;li&gt;SuiChat-CN: 53.4 (#36/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Flash-8B (001)&lt;/strong&gt; — ELO 1476, #441&lt;ul&gt;&lt;li&gt;Translation Set1 to en COMET22: 88.5 (#9/13)&lt;/li&gt;&lt;li&gt;Translation Set1 to en spBleu: 41.4 (#10/13)&lt;/li&gt;&lt;li&gt;Translation en to Set1 COMET22: 88.0 (#11/13)&lt;/li&gt;&lt;li&gt;Translation en to Set1 spBleu: 38.2 (#11/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Sonnet (20240229)&lt;/strong&gt; — ELO 1474, #443&lt;ul&gt;&lt;li&gt;RepoQA: 87.4 (#5/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E4B&lt;/strong&gt; — ELO 1472, #445&lt;ul&gt;&lt;li&gt;P3B3: 94.4 (#4/20)&lt;/li&gt;&lt;li&gt;POLAR-Bench: 90.87 (#4/22)&lt;/li&gt;&lt;li&gt;TeleResilienceBench: 23.7 (#5/8)&lt;/li&gt;&lt;li&gt;IFMTBench: 72.56 (#9/15)&lt;/li&gt;&lt;li&gt;IntentGrasp: 45.87 (#9/20)&lt;/li&gt;&lt;li&gt;HardMTBench: 82.69 (#15/20)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 85.0 (#125/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral 3 3B&lt;/strong&gt; — ELO 1469, #450&lt;ul&gt;&lt;li&gt;AgentFloor: 42.7 (#10/17)&lt;/li&gt;&lt;li&gt;POLAR-Bench: 65.25 (#21/22)&lt;/li&gt;&lt;li&gt;AA-LCR: 11.7 (#253/355)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 52.35 (#290/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 2B&lt;/strong&gt; — ELO 1468, #452&lt;ul&gt;&lt;li&gt;Benchmarking Large Language Models for Graphem: 87.3 (#2/37)&lt;/li&gt;&lt;li&gt;StemBind: 35.9 (#7/24)&lt;/li&gt;&lt;li&gt;Agentick: 13.3 (#7/15)&lt;/li&gt;&lt;li&gt;SAGE: 54.12 (#11/12)&lt;/li&gt;&lt;li&gt;ArxivMath: 10.62 (#20/20)&lt;/li&gt;&lt;li&gt;SVFSearch: 68.5 (#24/75)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 79.0 (#135/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Nemo Instruct (2407)&lt;/strong&gt; — ELO 1468, #453&lt;ul&gt;&lt;li&gt;SECQUE: 46.0 (#7/7)&lt;/li&gt;&lt;li&gt;Generate README Eval: 25.62 (#13/14)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 969.6 (#92/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Command-R+&lt;/strong&gt; — ELO 1468, #454&lt;ul&gt;&lt;li&gt;IDE-Bench: 0.0 (#15/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3-medium-128k-instruct&lt;/strong&gt; — ELO 1467, #457&lt;ul&gt;&lt;li&gt;BBH: 81.4 (#3/16)&lt;/li&gt;&lt;li&gt;RepoQA: 63.2 (#14/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Haiku&lt;/strong&gt; — ELO 1466, #458&lt;ul&gt;&lt;li&gt;Multi-IF: 0.73 (#3/33)&lt;/li&gt;&lt;li&gt;Natural2Code: 36.2 (#17/30)&lt;/li&gt;&lt;li&gt;MBPP+: 68.8 (#21/25)&lt;/li&gt;&lt;li&gt;EvalPlus: 68.85 (#24/25)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 877.2 (#100/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-3.5 Turbo&lt;/strong&gt; — ELO 1465, #460&lt;ul&gt;&lt;li&gt;CyberSecEval: 39.13 (#6/7)&lt;/li&gt;&lt;li&gt;NarrativeWorldBench: 54.0 (#10/10)&lt;/li&gt;&lt;li&gt;AutoLogi: 18.93 (#10/10)&lt;/li&gt;&lt;li&gt;QUIET: 6.44 (#12/12)&lt;/li&gt;&lt;li&gt;Natural2Code: 40.7 (#14/30)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 40.0 (#355/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 4B&lt;/strong&gt; — ELO 1464, #463&lt;ul&gt;&lt;li&gt;ProtStructQA: 70.33 (#1/4)&lt;/li&gt;&lt;li&gt;CULTURE-MT: 60.98 (#3/15)&lt;/li&gt;&lt;li&gt;MuPPET: 59.26 (#4/7)&lt;/li&gt;&lt;li&gt;BehaviorBench: 26.9 (#5/20)&lt;/li&gt;&lt;li&gt;Benchmarking Large Language Models for Graphem: 57.72 (#5/37)&lt;/li&gt;&lt;li&gt;TIDE-Bench: 89.6 (#5/8)&lt;/li&gt;&lt;li&gt;When2Speak: 20.6 (#6/6)&lt;/li&gt;&lt;li&gt;Agentick: 8.5 (#9/15)&lt;/li&gt;&lt;li&gt;PassBench: 10.8 (#11/11)&lt;/li&gt;&lt;li&gt;When Seekers Are Hard to Help: 1.74 (#11/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;c4ai-command-r-v01&lt;/strong&gt; — ELO 1464, #465&lt;ul&gt;&lt;li&gt;ToolSandbox: 26.2 (#11/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3n E4B&lt;/strong&gt; — ELO 1463, #466&lt;ul&gt;&lt;li&gt;CulturaQA: 69.1 (#7/9)&lt;/li&gt;&lt;li&gt;TRLawBench: 50.0 (#30/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Molmo2-8B&lt;/strong&gt; — ELO 1463, #467&lt;ul&gt;&lt;li&gt;TableVista: 39.9 (#21/29)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (en): 44.7 (#34/38)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (zh): 21.1 (#37/37)&lt;/li&gt;&lt;li&gt;AA-LCR: 0.0 (#297/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Haiku (20240307)&lt;/strong&gt; — ELO 1462, #468&lt;ul&gt;&lt;li&gt;ToolSandbox: 54.9 (#7/13)&lt;/li&gt;&lt;li&gt;RepoQA: 81.8 (#8/33)&lt;/li&gt;&lt;li&gt;HELM Safety: 87.7981 (#40/57)&lt;/li&gt;&lt;li&gt;HELM Lite: 29.4206 (#63/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;text-davinci-002&lt;/strong&gt; — ELO 1462, #470&lt;ul&gt;&lt;li&gt;HELM: 90.5 (#3/65)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2 7B Instruct&lt;/strong&gt; — ELO 1461, #471&lt;ul&gt;&lt;li&gt;IndoBias: 65.3 (#15/26)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 1.5 14B Chat&lt;/strong&gt; — ELO 1461, #472&lt;ul&gt;&lt;li&gt;RepoQA: 26.0 (#27/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 2 9B (IT)&lt;/strong&gt; — ELO 1459, #474&lt;ul&gt;&lt;li&gt;Fin-Bias: 97.0 (#7/19)&lt;/li&gt;&lt;li&gt;Do LLMs Build World Models From Text? A Multil: 13.7 (#9/14)&lt;/li&gt;&lt;li&gt;IndoBias: 67.3 (#12/26)&lt;/li&gt;&lt;li&gt;Open FinLLM Leaderboard: 14.32 (#18/25)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 47.1 (#41/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 7B Instruct&lt;/strong&gt; — ELO 1458, #475&lt;ul&gt;&lt;li&gt;NL2Scratch: 97.9 (#4/8)&lt;/li&gt;&lt;li&gt;Do LLMs Build World Models From Text? A Multil: 18.9 (#5/14)&lt;/li&gt;&lt;li&gt;BLUEX v2: 6.93 (#7/10)&lt;/li&gt;&lt;li&gt;Finetuning with Scientific Data Increases Hall: 65.2 (#7/18)&lt;/li&gt;&lt;li&gt;ThaiSafetyBench: 14.43 (#7/24)&lt;/li&gt;&lt;li&gt;AutoLogi: 27.28 (#8/10)&lt;/li&gt;&lt;li&gt;StructEval: 59.03 (#9/12)&lt;/li&gt;&lt;li&gt;MedGUIDE: 50.1 (#11/25)&lt;/li&gt;&lt;li&gt;When Reviews Disagree: 28.54 (#13/13)&lt;/li&gt;&lt;li&gt;Active Evidence-Seeking and Diagnostic Reasoni: 23.3 (#14/15)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mixtral 8x7B Instruct (v0.1)&lt;/strong&gt; — ELO 1458, #476&lt;ul&gt;&lt;li&gt;RepoQA: 68.0 (#11/33)&lt;/li&gt;&lt;li&gt;MedGUIDE: 49.1 (#12/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 2 9B&lt;/strong&gt; — ELO 1455, #482&lt;ul&gt;&lt;li&gt;StakeBench: 15.2 (#5/15)&lt;/li&gt;&lt;li&gt;PhysicsFinals: 11.9 (#22/34)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Pixtral-12B&lt;/strong&gt; — ELO 1454, #484&lt;ul&gt;&lt;li&gt;Chartographer: 82.7 (#14/15)&lt;/li&gt;&lt;li&gt;MMVU: 32.2 (#36/40)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3-small-8k-instruct&lt;/strong&gt; — ELO 1454, #485&lt;ul&gt;&lt;li&gt;BBH: 79.1 (#5/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 2.1&lt;/strong&gt; — ELO 1454, #486&lt;ul&gt;&lt;li&gt;Natural2Code: 34.4 (#18/30)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 8B Instruct&lt;/strong&gt; — ELO 1453, #487&lt;ul&gt;&lt;li&gt;MathTutorBench: 47.0 (#4/8)&lt;/li&gt;&lt;li&gt;EnterpriseArena: 40.0 (#5/27)&lt;/li&gt;&lt;li&gt;SECQUE: 48.0 (#6/7)&lt;/li&gt;&lt;li&gt;NL2Scratch: 96.5 (#7/8)&lt;/li&gt;&lt;li&gt;Finetuning with Scientific Data Increases Hall: 65.0 (#8/18)&lt;/li&gt;&lt;li&gt;PrivacyPeek: 72.76 (#8/10)&lt;/li&gt;&lt;li&gt;StructEval: 61.77 (#8/12)&lt;/li&gt;&lt;li&gt;BLUEX v2: 4.35 (#9/10)&lt;/li&gt;&lt;li&gt;TAEF (Text Analytics Evaluation Framework): 65.5 (#9/11)&lt;/li&gt;&lt;li&gt;AutoLogi: 25.53 (#9/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.2 11B Instruct&lt;/strong&gt; — ELO 1453, #488&lt;ul&gt;&lt;li&gt;GeoRC: 25.86 (#12/15)&lt;/li&gt;&lt;li&gt;CFMME: 20.2 (#16/16)&lt;/li&gt;&lt;li&gt;MechVQA: 25.48 (#17/17)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#245/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 11.7 (#256/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Flash-8B&lt;/strong&gt; — ELO 1453, #489&lt;ul&gt;&lt;li&gt;Natural2Code: 75.5 (#5/30)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.0 Pro&lt;/strong&gt; — ELO 1448, #500&lt;ul&gt;&lt;li&gt;EnactToM: 53.0 (#1/7)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 VL 7B Instruct&lt;/strong&gt; — ELO 1448, #501&lt;ul&gt;&lt;li&gt;LVBench: 45.3 (#30/49)&lt;/li&gt;&lt;li&gt;VideoMME w sub.: 71.6 (#30/65)&lt;/li&gt;&lt;li&gt;VideoMME w/o sub.: 65.1 (#31/61)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 4B (IT)&lt;/strong&gt; — ELO 1446, #502&lt;ul&gt;&lt;li&gt;IndoBias: 69.4 (#6/26)&lt;/li&gt;&lt;li&gt;FIND: 61.5 (#7/9)&lt;/li&gt;&lt;li&gt;ALARB: 24.5 (#10/12)&lt;/li&gt;&lt;li&gt;SceneFunRI: 4.21 (#11/17)&lt;/li&gt;&lt;li&gt;C4STYLI: 55.8 (#16/18)&lt;/li&gt;&lt;li&gt;ThaiSafetyBench: 28.11 (#19/24)&lt;/li&gt;&lt;li&gt;MedAgentGym: 21.57 (#19/29)&lt;/li&gt;&lt;li&gt;EQ-Bench: 977.2 (#63/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1113.6 (#85/123)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#175/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-3.5&lt;/strong&gt; — ELO 1446, #504&lt;ul&gt;&lt;li&gt;TukaBench: 38.1 (#1/13)&lt;/li&gt;&lt;li&gt;PersonaArena: 3.46 (#12/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mixtral 8x7B Instruct&lt;/strong&gt; — ELO 1445, #506&lt;ul&gt;&lt;li&gt;ENAMEL: 26.6 (#13/31)&lt;/li&gt;&lt;li&gt;EnterpriseArena: 0.0 (#23/27)&lt;/li&gt;&lt;li&gt;LiveSQLBench: 2.41 (#33/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3 Mini 4K Instruct&lt;/strong&gt; — ELO 1443, #510&lt;ul&gt;&lt;li&gt;BBH: 71.7 (#7/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1 Distill Qwen 14B&lt;/strong&gt; — ELO 1441, #512&lt;ul&gt;&lt;li&gt;Active Evidence-Seeking and Diagnostic Reasoni: 23.3 (#13/15)&lt;/li&gt;&lt;li&gt;OJBench: 14.17 (#25/44)&lt;/li&gt;&lt;li&gt;HMMT 2025: 31.67 (#80/89)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 3B&lt;/strong&gt; — ELO 1441, #513&lt;ul&gt;&lt;li&gt;Relevance as a Vulnerability: 3.22 (#2/8)&lt;/li&gt;&lt;li&gt;Forge: 13.8 (#20/21)&lt;/li&gt;&lt;li&gt;EHRBench: 37.87 (#29/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-4 Multimodal Instruct&lt;/strong&gt; — ELO 1441, #514&lt;ul&gt;&lt;li&gt;DentalGPT Dental Eval Suite: 52.0 (#11/16)&lt;/li&gt;&lt;li&gt;AudioMC: 15.49 (#24/31)&lt;/li&gt;&lt;li&gt;OCRBench v2: 38.1 (#29/29)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (zh): 37.3 (#36/37)&lt;/li&gt;&lt;li&gt;OCRBench-V2 (en): 38.1 (#38/38)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.1 8B&lt;/strong&gt; — ELO 1439, #515&lt;ul&gt;&lt;li&gt;When Context Flips, Safety Breaks: 77.6 (#1/12)&lt;/li&gt;&lt;li&gt;Multi-IF: 0.69 (#1/33)&lt;/li&gt;&lt;li&gt;When Lower Privileges Suffice: 55.9 (#2/11)&lt;/li&gt;&lt;li&gt;MixRea: 20.3 (#2/21)&lt;/li&gt;&lt;li&gt;CLEAR: 3.1 (#2/15)&lt;/li&gt;&lt;li&gt;IndoBias: 71.4 (#3/26)&lt;/li&gt;&lt;li&gt;The Wrong Kind of Right: 28.2 (#4/26)&lt;/li&gt;&lt;li&gt;When2Speak: 33.7 (#4/6)&lt;/li&gt;&lt;li&gt;TSCG: 78.4 (#4/13)&lt;/li&gt;&lt;li&gt;Beyond Continuity: 69.9 (#5/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3n E4B Instruct&lt;/strong&gt; — ELO 1438, #516&lt;ul&gt;&lt;li&gt;ECLeKTic: 19.0 (#5/14)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#177/342)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 48.83 (#298/346)&lt;/li&gt;&lt;li&gt;AA-LCR: 0.0 (#308/355)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude 3 Sonnet&lt;/strong&gt; — ELO 1437, #517&lt;ul&gt;&lt;li&gt;Multi-IF: 0.78 (#5/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Jamba 1.7 Mini&lt;/strong&gt; — ELO 1435, #521&lt;ul&gt;&lt;li&gt;AA MMLU-Pro: 38.82 (#322/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-3.5 Turbo (0613)&lt;/strong&gt; — ELO 1434, #522&lt;ul&gt;&lt;li&gt;HELM: 78.3 (#10/65)&lt;/li&gt;&lt;li&gt;HELM Lite: 40.0283 (#47/77)&lt;/li&gt;&lt;li&gt;HELM Safety: 85.2869 (#49/57)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 505.0 (#110/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-3.5 Turbo (1106)&lt;/strong&gt; — ELO 1434, #524&lt;ul&gt;&lt;li&gt;BBH: 61.59 (#9/16)&lt;/li&gt;&lt;li&gt;MBPP+: 69.7 (#15/25)&lt;/li&gt;&lt;li&gt;EvalPlus: 70.2 (#21/25)&lt;/li&gt;&lt;li&gt;Inverse Turing Bench: 39.86 (#24/24)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 E2B&lt;/strong&gt; — ELO 1431, #528&lt;ul&gt;&lt;li&gt;TeleResilienceBench: 24.5 (#4/8)&lt;/li&gt;&lt;li&gt;IFMTBench: 58.69 (#13/15)&lt;/li&gt;&lt;li&gt;POLAR-Bench: 79.74 (#13/22)&lt;/li&gt;&lt;li&gt;IntentGrasp: 40.52 (#14/20)&lt;/li&gt;&lt;li&gt;HardMTBench: 78.44 (#17/20)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 80.0 (#134/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 3B Instruct&lt;/strong&gt; — ELO 1431, #529&lt;ul&gt;&lt;li&gt;When Simulation Lies: 39.0 (#17/22)&lt;/li&gt;&lt;li&gt;OPT-BENCH: 15.0 (#19/19)&lt;/li&gt;&lt;li&gt;PlantMarkerBench: 24.7 (#46/47)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral-7B-v0.1&lt;/strong&gt; — ELO 1431, #530&lt;ul&gt;&lt;li&gt;BBH: 56.1 (#12/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Nemo&lt;/strong&gt; — ELO 1429, #532&lt;ul&gt;&lt;li&gt;ECLeKTic: 7.1 (#9/14)&lt;/li&gt;&lt;li&gt;TRLawBench: 59.4 (#24/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-3.5 Turbo (0125)&lt;/strong&gt; — ELO 1428, #534&lt;ul&gt;&lt;li&gt;ToolSandbox: 65.6 (#3/13)&lt;/li&gt;&lt;li&gt;Open FinLLM Leaderboard: 23.16 (#12/25)&lt;/li&gt;&lt;li&gt;RepoQA: 60.4 (#17/33)&lt;/li&gt;&lt;li&gt;TextClass Benchmark: 1560.51 (#44/108)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 0.0 (#151/153)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 2.22 (#220/230)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3 8B&lt;/strong&gt; — ELO 1426, #538&lt;ul&gt;&lt;li&gt;MixRea: 18.3 (#3/21)&lt;/li&gt;&lt;li&gt;Diagnosing LLM Arbitration Behavior over Pre-e: -66.1 (#7/7)&lt;/li&gt;&lt;li&gt;IntentGrasp: 28.36 (#19/20)&lt;/li&gt;&lt;li&gt;EHRBench: 48.9 (#24/31)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 23.3 (#44/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SmolLM3-3B&lt;/strong&gt; — ELO 1425, #540&lt;ul&gt;&lt;li&gt;POLAR-Bench: 62.22 (#22/22)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3 8B Instruct&lt;/strong&gt; — ELO 1423, #544&lt;ul&gt;&lt;li&gt;Pseudo-Deliberation in Language Models: 47.7 (#2/4)&lt;/li&gt;&lt;li&gt;CyberSecEval: 45.27 (#7/7)&lt;/li&gt;&lt;li&gt;SciPaths: 4.1 (#9/10)&lt;/li&gt;&lt;li&gt;K12-Bench: 7.2 (#10/11)&lt;/li&gt;&lt;li&gt;When Reviews Disagree: 35.41 (#11/13)&lt;/li&gt;&lt;li&gt;StructEval: 51.59 (#11/12)&lt;/li&gt;&lt;li&gt;Active Evidence-Seeking and Diagnostic Reasoni: 24.8 (#12/15)&lt;/li&gt;&lt;li&gt;EnterpriseArena: 20.0 (#13/27)&lt;/li&gt;&lt;li&gt;Open FinLLM Leaderboard: 18.93 (#15/25)&lt;/li&gt;&lt;li&gt;C4STYLI: 53.5 (#18/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Granite 4.0 H 1B&lt;/strong&gt; — ELO 1422, #547&lt;ul&gt;&lt;li&gt;AA MMLU-Pro: 27.74 (#336/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1 Distill Llama 8B&lt;/strong&gt; — ELO 1420, #548&lt;ul&gt;&lt;li&gt;OJBench: 8.46 (#32/44)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 43.7 (#42/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Command R&lt;/strong&gt; — ELO 1419, #549&lt;ul&gt;&lt;li&gt;HELM Safety: 80.9403 (#54/57)&lt;/li&gt;&lt;li&gt;HELM Lite: 33.365 (#56/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 1.7B&lt;/strong&gt; — ELO 1417, #551&lt;ul&gt;&lt;li&gt;When Multiple Scripts Matter: 29.73 (#2/6)&lt;/li&gt;&lt;li&gt;CULTURE-MT: 83.53 (#2/15)&lt;/li&gt;&lt;li&gt;ProtStructQA: 28.69 (#3/4)&lt;/li&gt;&lt;li&gt;ActTraitBench: 0.19 (#15/15)&lt;/li&gt;&lt;li&gt;ProactBench: 10.3 (#16/16)&lt;/li&gt;&lt;li&gt;PersonaArena: 3.09 (#18/18)&lt;/li&gt;&lt;li&gt;K-MetBench: 46.8 (#42/59)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 2 70B Chat&lt;/strong&gt; — ELO 1417, #552&lt;ul&gt;&lt;li&gt;Finetuning with Scientific Data Increases Hall: 62.2 (#12/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 4B&lt;/strong&gt; — ELO 1413, #556&lt;ul&gt;&lt;li&gt;CounterCount: 44.57 (#4/7)&lt;/li&gt;&lt;li&gt;Large Language Models Lack Temporal Awareness: 58.16 (#5/14)&lt;/li&gt;&lt;li&gt;Natural2Code: 70.3 (#6/30)&lt;/li&gt;&lt;li&gt;Benchmarking Large Language Models for Graphem: 56.69 (#7/37)&lt;/li&gt;&lt;li&gt;SAGE: 60.79 (#8/12)&lt;/li&gt;&lt;li&gt;LaViSA: 51.0 (#10/10)&lt;/li&gt;&lt;li&gt;ECLeKTic: 4.6 (#10/14)&lt;/li&gt;&lt;li&gt;The Age of Curiosity Meets the Age of AI: Benc: 4.4 (#11/13)&lt;/li&gt;&lt;li&gt;NeedleBench: 64.42 (#12/12)&lt;/li&gt;&lt;li&gt;BIG-Bench Extra Hard: 3.4 (#19/20)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral 7B Instruct (v0.3)&lt;/strong&gt; — ELO 1413, #557&lt;ul&gt;&lt;li&gt;Do LLMs Build World Models From Text? A Multil: 1.0 (#12/14)&lt;/li&gt;&lt;li&gt;RepoQA: 62.0 (#16/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 2 2B (IT)&lt;/strong&gt; — ELO 1408, #563&lt;ul&gt;&lt;li&gt;XDomainBench: 27.3 (#6/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OLMo 3 7B Instruct&lt;/strong&gt; — ELO 1407, #565&lt;ul&gt;&lt;li&gt;IndoBias: 51.0 (#25/26)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#289/342)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-4 Mini Instruct&lt;/strong&gt; — ELO 1405, #568&lt;ul&gt;&lt;li&gt;Relevance as a Vulnerability: 1.67 (#8/8)&lt;/li&gt;&lt;li&gt;HarmActionsEval: 0.0 (#9/10)&lt;/li&gt;&lt;li&gt;StructEval: 56.97 (#10/12)&lt;/li&gt;&lt;li&gt;Korean Canonical Legal Benchmark: 24.75 (#31/31)&lt;/li&gt;&lt;li&gt;K-MetBench: 30.4 (#55/59)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 10.76 (#128/128)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.2 3B Instruct&lt;/strong&gt; — ELO 1404, #570&lt;ul&gt;&lt;li&gt;MathTutorBench: 46.89 (#5/8)&lt;/li&gt;&lt;li&gt;PrivacyPeek: 54.48 (#10/10)&lt;/li&gt;&lt;li&gt;TAEF (Text Analytics Evaluation Framework): 38.5 (#10/11)&lt;/li&gt;&lt;li&gt;MedCTA: 11.29 (#12/18)&lt;/li&gt;&lt;li&gt;MedGUIDE: 41.7 (#19/25)&lt;/li&gt;&lt;li&gt;When Simulation Lies: 34.1 (#20/22)&lt;/li&gt;&lt;li&gt;HealthBench Hard: 26.0 (#48/55)&lt;/li&gt;&lt;li&gt;K-MetBench: 33.8 (#50/59)&lt;/li&gt;&lt;li&gt;WritingBench: 38.14 (#65/66)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 709.4 (#109/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.5 0.8B&lt;/strong&gt; — ELO 1403, #571&lt;ul&gt;&lt;li&gt;Agentick: 9.4 (#8/15)&lt;/li&gt;&lt;li&gt;StemBind: 30.2 (#16/24)&lt;/li&gt;&lt;li&gt;SceneFunRI: 3.63 (#16/17)&lt;/li&gt;&lt;li&gt;SVFSearch: 34.1 (#72/75)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3 Mini 128K Instruct&lt;/strong&gt; — ELO 1403, #572&lt;ul&gt;&lt;li&gt;RepoQA: 22.4 (#29/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral 7B&lt;/strong&gt; — ELO 1402, #574&lt;ul&gt;&lt;li&gt;The Wrong Kind of Right: 26.8 (#5/26)&lt;/li&gt;&lt;li&gt;Diagnosing LLM Arbitration Behavior over Pre-e: -19.0 (#5/7)&lt;/li&gt;&lt;li&gt;MHGraphBench: 42.1 (#8/15)&lt;/li&gt;&lt;li&gt;ChaosBench-Logic v2: 22.8 (#10/10)&lt;/li&gt;&lt;li&gt;StakeBench: 4.5 (#14/15)&lt;/li&gt;&lt;li&gt;LegalCiteBench: 58.5 (#15/21)&lt;/li&gt;&lt;li&gt;J1-ENVS: 26.71 (#15/17)&lt;/li&gt;&lt;li&gt;PhysicsFinals: 11.7 (#24/34)&lt;/li&gt;&lt;li&gt;EHRBench: 38.23 (#28/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 1.5 7B Chat&lt;/strong&gt; — ELO 1401, #576&lt;ul&gt;&lt;li&gt;RepoQA: 2.8 (#32/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral 7B Instruct&lt;/strong&gt; — ELO 1400, #577&lt;ul&gt;&lt;li&gt;PlantMarkerBench: 69.0 (#8/47)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 24.2 (#43/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;gemma-3n-E2B-it Instruct&lt;/strong&gt; — ELO 1399, #579&lt;ul&gt;&lt;li&gt;ECLeKTic: 2.5 (#12/14)&lt;/li&gt;&lt;li&gt;CritPt: 0.0 (#176/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 0.0 (#307/355)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 37.82 (#324/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LFM2 2.6B&lt;/strong&gt; — ELO 1398, #580&lt;ul&gt;&lt;li&gt;AA MMLU-Pro: 29.78 (#334/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;gemma-7B&lt;/strong&gt; — ELO 1398, #581&lt;ul&gt;&lt;li&gt;NRITYAM: 35.32 (#7/7)&lt;/li&gt;&lt;li&gt;BBH: 55.1 (#13/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral 7B Instruct (v0.2)&lt;/strong&gt; — ELO 1396, #583&lt;ul&gt;&lt;li&gt;RepoQA: 47.4 (#20/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 1.5B&lt;/strong&gt; — ELO 1392, #586&lt;ul&gt;&lt;li&gt;On Stable Long-Form Generation: 19.6 (#7/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.2 3B&lt;/strong&gt; — ELO 1383, #598&lt;ul&gt;&lt;li&gt;SAGE: 59.54 (#10/12)&lt;/li&gt;&lt;li&gt;StakeBench: 9.2 (#11/15)&lt;/li&gt;&lt;li&gt;XDomainBench: 26.8 (#11/14)&lt;/li&gt;&lt;li&gt;Large Language Models Lack Temporal Awareness: 53.63 (#11/14)&lt;/li&gt;&lt;li&gt;The Wrong Kind of Right: 18.2 (#14/26)&lt;/li&gt;&lt;li&gt;PersonaArena: 3.29 (#16/18)&lt;/li&gt;&lt;li&gt;LegalCiteBench: 43.1 (#20/21)&lt;/li&gt;&lt;li&gt;EHRBench: 49.85 (#23/31)&lt;/li&gt;&lt;li&gt;PlantMarkerBench: 44.9 (#41/47)&lt;/li&gt;&lt;li&gt;IneqMath: 0.0 (#41/42)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 0.6B&lt;/strong&gt; — ELO 1380, #601&lt;ul&gt;&lt;li&gt;When Multiple Scripts Matter: 59.09 (#1/6)&lt;/li&gt;&lt;li&gt;CULTURE-MT: 95.41 (#1/15)&lt;/li&gt;&lt;li&gt;ProtStructQA: 21.15 (#4/4)&lt;/li&gt;&lt;li&gt;ChLogic: 78.3 (#6/7)&lt;/li&gt;&lt;li&gt;AgentFloor: 29.2 (#15/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 2 13B&lt;/strong&gt; — ELO 1380, #602&lt;ul&gt;&lt;li&gt;VerdictBench: 50.42 (#12/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral 7B Instruct (v0.1)&lt;/strong&gt; — ELO 1365, #615&lt;ul&gt;&lt;li&gt;Open FinLLM Leaderboard: 9.14 (#20/25)&lt;/li&gt;&lt;li&gt;RepoQA: 11.0 (#30/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Granite 4.0 H 350M&lt;/strong&gt; — ELO 1364, #619&lt;ul&gt;&lt;li&gt;AA MMLU-Pro: 12.7 (#344/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Granite 4.0 350M&lt;/strong&gt; — ELO 1361, #623&lt;ul&gt;&lt;li&gt;AA MMLU-Pro: 12.36 (#345/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;gemma-7B (IT)&lt;/strong&gt; — ELO 1360, #624&lt;ul&gt;&lt;li&gt;Fin-Bias: 97.6 (#4/19)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 1B (IT)&lt;/strong&gt; — ELO 1357, #625&lt;ul&gt;&lt;li&gt;CritPt: 0.0 (#172/342)&lt;/li&gt;&lt;li&gt;AA-LCR: 0.0 (#305/355)&lt;/li&gt;&lt;li&gt;AA MMLU-Pro: 13.47 (#343/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-2&lt;/strong&gt; — ELO 1357, #626&lt;ul&gt;&lt;li&gt;HELM Lite: 19.1392 (#70/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 2 7B Chat&lt;/strong&gt; — ELO 1356, #627&lt;ul&gt;&lt;li&gt;Finetuning with Scientific Data Increases Hall: 61.4 (#13/18)&lt;/li&gt;&lt;li&gt;IndoBias: 61.2 (#21/26)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 3 1B&lt;/strong&gt; — ELO 1356, #628&lt;ul&gt;&lt;li&gt;Natural2Code: 56.0 (#7/30)&lt;/li&gt;&lt;li&gt;BIG-Bench Extra Hard: 7.2 (#11/20)&lt;/li&gt;&lt;li&gt;ECLeKTic: 1.4 (#14/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 0.5B&lt;/strong&gt; — ELO 1341, #641&lt;ul&gt;&lt;li&gt;PlantMarkerBench: 66.7 (#23/47)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.2 1B Instruct&lt;/strong&gt; — ELO 1338, #643&lt;ul&gt;&lt;li&gt;Open FinLLM Leaderboard: 8.95 (#21/25)&lt;/li&gt;&lt;li&gt;MedGUIDE: 28.9 (#22/25)&lt;/li&gt;&lt;li&gt;HealthBench Hard: 25.0 (#49/55)&lt;/li&gt;&lt;li&gt;K-MetBench: 3.5 (#59/59)&lt;/li&gt;&lt;li&gt;WritingBench: 28.74 (#66/66)&lt;/li&gt;&lt;li&gt;EQ-Bench: 200.0 (#79/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 200.0 (#111/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 2 7B&lt;/strong&gt; — ELO 1338, #645&lt;ul&gt;&lt;li&gt;BBH: 58.5 (#11/16)&lt;/li&gt;&lt;li&gt;IndoBias: 63.3 (#18/26)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek R1 Distill Qwen 1.5B&lt;/strong&gt; — ELO 1333, #648&lt;ul&gt;&lt;li&gt;OJBench: 2.59 (#41/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Llama 3.2 1B&lt;/strong&gt; — ELO 1317, #658&lt;ul&gt;&lt;li&gt;SAGE: 53.67 (#12/12)&lt;/li&gt;&lt;li&gt;LegalCiteBench: 39.1 (#21/21)&lt;/li&gt;&lt;li&gt;PlantMarkerBench: 66.7 (#22/47)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;gpt-neox-20B&lt;/strong&gt; — ELO 1308, #664&lt;ul&gt;&lt;li&gt;HELM: 35.1 (#45/65)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;gpt-j-6B&lt;/strong&gt; — ELO 1274, #680&lt;ul&gt;&lt;li&gt;HELM: 27.28 (#51/65)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Mythos Preview&lt;/strong&gt; — ELO 1772&lt;ul&gt;&lt;li&gt;USAMO25: 97.6 (#1/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CodeLlama-34B-Instruct&lt;/strong&gt; — ELO 1405&lt;ul&gt;&lt;li&gt;CyberSecEval: 36.33 (#4/7)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek Coder V2&lt;/strong&gt; — ELO 1548&lt;ul&gt;&lt;li&gt;OJBench: 8.24 (#33/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSeek Reasoner&lt;/strong&gt; — ELO 1652&lt;ul&gt;&lt;li&gt;Xent Games: 62.67 (#4/12)&lt;/li&gt;&lt;li&gt;TRLawBench: 73.8 (#12/32)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Doubao-Seed-1.6&lt;/strong&gt; — ELO 1635&lt;ul&gt;&lt;li&gt;StressEval: 28.1 (#8/10)&lt;/li&gt;&lt;li&gt;VerdictBench: 56.26 (#9/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ERNIE 5.0&lt;/strong&gt; — ELO 1612&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 92.0 (#111/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-4 32B&lt;/strong&gt; — ELO 1566&lt;ul&gt;&lt;li&gt;EHRBench: 66.12 (#7/31)&lt;/li&gt;&lt;li&gt;Benchmarking Large Language Models for Graphem: 35.62 (#9/37)&lt;/li&gt;&lt;li&gt;Active Evidence-Seeking and Diagnostic Reasoni: 35.7 (#9/15)&lt;/li&gt;&lt;li&gt;AsyncTool: 15.17 (#13/19)&lt;/li&gt;&lt;li&gt;Trip+: 54.43 (#17/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GLM-5 FP8&lt;/strong&gt; — ELO 1693&lt;ul&gt;&lt;li&gt;TuRTLe Code Completion (Icarus Verilog): 83.98 (#1/44)&lt;/li&gt;&lt;li&gt;TuRTLe Code Completion (Verilator): 82.23 (#1/44)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Icarus Verilog): 79.46 (#3/44)&lt;/li&gt;&lt;li&gt;TuRTLe Spec-to-RTL (Verilator): 78.17 (#3/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-4 Turbo (Preview)&lt;/strong&gt; — ELO 1540&lt;ul&gt;&lt;li&gt;ENAMEL: 47.0 (#2/31)&lt;/li&gt;&lt;li&gt;MBPP+: 73.3 (#8/25)&lt;/li&gt;&lt;li&gt;EvalPlus: 77.5 (#10/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Codex Max&lt;/strong&gt; — ELO 1686&lt;ul&gt;&lt;li&gt;IDE-Bench: 73.75 (#5/15)&lt;/li&gt;&lt;li&gt;SmellBench: 34.7 (#7/9)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.1 Instant&lt;/strong&gt; — ELO 1600&lt;ul&gt;&lt;li&gt;TutorBench: 49.08 (#18/23)&lt;/li&gt;&lt;li&gt;EnigmaEval: 1.94 (#30/39)&lt;/li&gt;&lt;li&gt;MultiNRC: 18.29 (#32/39)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 34.87 (#41/54)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.2 ChatGPT&lt;/strong&gt; — ELO 1696&lt;ul&gt;&lt;li&gt;VerdictBench: 63.44 (#5/17)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Instant&lt;/strong&gt; — ELO 1669&lt;ul&gt;&lt;li&gt;CharXiv-R: 81.6 (#23/60)&lt;/li&gt;&lt;li&gt;OmniDocBench 1.5: 87.5 (#35/64)&lt;/li&gt;&lt;li&gt;Epoch AI - Critpt: 0.0 (#136/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Pro Sol&lt;/strong&gt; — ELO 1771&lt;ul&gt;&lt;li&gt;LM Market Cap LMC Score: 89.0 (#41/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 1.5 Flash 8B (Preview 0827)&lt;/strong&gt; — ELO 1487&lt;ul&gt;&lt;li&gt;Generate README Eval: 32.12 (#12/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.0 Flash Lite (Preview 02-05)&lt;/strong&gt; — ELO 1520&lt;ul&gt;&lt;li&gt;HELM Safety: 90.7886 (#29/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Flash (Preview)&lt;/strong&gt; — ELO 1629&lt;ul&gt;&lt;li&gt;Reward Hacking Benchmark (RHB): 0.8 (#9/13)&lt;/li&gt;&lt;li&gt;EQ-Bench: 1164.5 (#47/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1221.8 (#76/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 2.5 Pro (Preview)&lt;/strong&gt; — ELO 1710&lt;ul&gt;&lt;li&gt;Reward Hacking Benchmark (RHB): 4.6 (#6/13)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemini 3.1 Flash&lt;/strong&gt; — ELO 1651&lt;ul&gt;&lt;li&gt;HarmVideoBench: 81.3 (#3/21)&lt;/li&gt;&lt;li&gt;Beyond Function Calling: 41.6 (#6/12)&lt;/li&gt;&lt;li&gt;CheXpercept: 87.1 (#8/14)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 24.0 (#58/153)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 37.78 (#167/230)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 12B (IT)&lt;/strong&gt; — ELO 1605&lt;ul&gt;&lt;li&gt;EQ-Bench: 1361.2 (#37/79)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 1270.4 (#67/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Gemma 4 26B&lt;/strong&gt; — ELO 1605&lt;ul&gt;&lt;li&gt;TeleResilienceBench: 27.2 (#3/8)&lt;/li&gt;&lt;li&gt;Polaris-Bench: 47.2 (#7/15)&lt;/li&gt;&lt;li&gt;AgentCIBench: 67.5 (#8/15)&lt;/li&gt;&lt;li&gt;DiagnosticIQ: 63.2 (#12/33)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 95.0 (#101/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 2&lt;/strong&gt; — ELO 1572&lt;ul&gt;&lt;li&gt;K-12EduBench: 64.1 (#14/23)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Grok 4.1&lt;/strong&gt; — ELO 1644&lt;ul&gt;&lt;li&gt;ResearchClawBench: 13.5 (#18/20)&lt;/li&gt;&lt;li&gt;Creative Writing v3: 85.43 (#117/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi Linear 48B A3B Instruct&lt;/strong&gt; — ELO 1503&lt;ul&gt;&lt;li&gt;ATLAS: 33.1 (#18/23)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna M.1&lt;/strong&gt; — ELO 1572&lt;ul&gt;&lt;li&gt;Vals Index: 35.27 (#33/35)&lt;/li&gt;&lt;li&gt;ProofBench: 0.0 (#49/49)&lt;/li&gt;&lt;li&gt;MedCode: 25.24 (#60/63)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 83.0 (#128/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Laguna XS.2&lt;/strong&gt; — ELO 1546&lt;ul&gt;&lt;li&gt;AIIQ Composite IQ: 83.0 (#129/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LongCat-Flash-Thinking-2601&lt;/strong&gt; — ELO 1640&lt;ul&gt;&lt;li&gt;IMO-AnswerBench: 78.6 (#19/22)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MiniMax M1 40k&lt;/strong&gt; — ELO 1577&lt;ul&gt;&lt;li&gt;AA MMLU-Pro: 80.83 (#99/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Ministral 8B&lt;/strong&gt; — ELO 1458&lt;ul&gt;&lt;li&gt;ChLogic: 92.03 (#5/7)&lt;/li&gt;&lt;li&gt;CommunityFact: 36.74 (#15/15)&lt;/li&gt;&lt;li&gt;EHRBench: 56.48 (#22/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Medium&lt;/strong&gt; — ELO 1479&lt;ul&gt;&lt;li&gt;ContextEcho: 47.0 (#10/23)&lt;/li&gt;&lt;li&gt;HELM Lite: 30.3197 (#62/77)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Mistral Small Creative&lt;/strong&gt; — ELO 1568&lt;ul&gt;&lt;li&gt;Creative Writing v3: 1371.1 (#60/123)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Muse Spark&lt;/strong&gt; — ELO 1731&lt;ul&gt;&lt;li&gt;MedXpertQA: 78.4 (#2/26)&lt;/li&gt;&lt;li&gt;CharXiv-R: 86.4 (#7/60)&lt;/li&gt;&lt;li&gt;Arena AI Document: 1444.0 (#14/27)&lt;/li&gt;&lt;li&gt;DeepSearchQA: 74.8 (#14/15)&lt;/li&gt;&lt;li&gt;OSWorld-Verified: 53.3 (#29/30)&lt;/li&gt;&lt;li&gt;Epoch AI - Scicode: 51.5 (#29/128)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 117.0 (#32/138)&lt;/li&gt;&lt;li&gt;Toolathlon: 49.4 (#33/39)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;NVIDIA Nemotron 3 Super&lt;/strong&gt; — ELO 1595&lt;ul&gt;&lt;li&gt;MathArena Apex: 7.81 (#29/51)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;NVIDIA-Nemotron-3-Super-120B-A12B-BF16&lt;/strong&gt; — ELO 1590&lt;ul&gt;&lt;li&gt;HMMT February 2026: 84.85 (#16/25)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Preview (2024-09-12)&lt;/strong&gt; — ELO 1586&lt;ul&gt;&lt;li&gt;TextClass Benchmark: 1622.24 (#31/108)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O1 Pro&lt;/strong&gt; — ELO 1629&lt;ul&gt;&lt;li&gt;EnigmaEval: 6.14 (#15/39)&lt;/li&gt;&lt;li&gt;Visual-Language Understanding: 47.32 (#16/54)&lt;/li&gt;&lt;li&gt;ZEROBench-Sub: 22.4 (#22/45)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 73.6 (#143/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;O3 Pro&lt;/strong&gt; — ELO 1686&lt;ul&gt;&lt;li&gt;IneqMath: 46.0 (#2/42)&lt;/li&gt;&lt;li&gt;NarrativeWorldBench: 79.0 (#5/10)&lt;/li&gt;&lt;li&gt;MCP Atlas: 44.5 (#41/42)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 86.7 (#64/406)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Phi-3-small-128k-instruct&lt;/strong&gt; — ELO 1446&lt;ul&gt;&lt;li&gt;RepoQA: 39.6 (#24/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 Coder 14B&lt;/strong&gt; — ELO 1445&lt;ul&gt;&lt;li&gt;OJBench: 6.3 (#34/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 Coder 32B&lt;/strong&gt; — ELO 1530&lt;ul&gt;&lt;li&gt;FormalRewardBench: 37.6 (#6/26)&lt;/li&gt;&lt;li&gt;OJBench: 5.77 (#35/44)&lt;/li&gt;&lt;li&gt;IneqMath: 1.5 (#36/42)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 Coder 7B&lt;/strong&gt; — ELO 1444&lt;ul&gt;&lt;li&gt;OJBench: 3.5 (#39/44)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 2.5 Max&lt;/strong&gt; — ELO 1561&lt;ul&gt;&lt;li&gt;RefusalBench: 29.8 (#4/19)&lt;/li&gt;&lt;li&gt;BigCodeBench-Hard: 29.1 (#14/20)&lt;/li&gt;&lt;li&gt;Balrog: 16.2 (#15/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 4B Instruct&lt;/strong&gt; — ELO 1548&lt;ul&gt;&lt;li&gt;SciPaths: 6.0 (#7/10)&lt;/li&gt;&lt;li&gt;PrivacyPeek: 71.32 (#9/10)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Coder Plus&lt;/strong&gt; — ELO 1597&lt;ul&gt;&lt;li&gt;AssertLLM2: 18.55 (#5/6)&lt;/li&gt;&lt;li&gt;FrontierOR: 20.0 (#6/7)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (TypeScript): 68.5 (#12/13)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (Rust): 82.0 (#12/13)&lt;/li&gt;&lt;li&gt;SpacetimeDB LLM Benchmark (C#): 76.4 (#12/13)&lt;/li&gt;&lt;li&gt;ALE-Bench: 456.5 (#61/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3 Max (2026-01-23)&lt;/strong&gt; — ELO 1667&lt;ul&gt;&lt;li&gt;IOI: 13.75 (#32/58)&lt;/li&gt;&lt;li&gt;ClawProBench: 55.76 (#33/57)&lt;/li&gt;&lt;li&gt;CaseLaw v2: 54.98 (#35/54)&lt;/li&gt;&lt;li&gt;MedScribe: 72.71 (#47/61)&lt;/li&gt;&lt;li&gt;MedCode: 31.37 (#56/63)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.6 Max&lt;/strong&gt; — ELO 1715&lt;ul&gt;&lt;li&gt;AgentCIBench: 97.4 (#2/15)&lt;/li&gt;&lt;li&gt;GroupTravelBench: 9.66 (#2/9)&lt;/li&gt;&lt;li&gt;PerfCodeBench: 66.32 (#2/20)&lt;/li&gt;&lt;li&gt;FORTIS: 51.3 (#2/10)&lt;/li&gt;&lt;li&gt;PDP-Bench: 71.31 (#3/7)&lt;/li&gt;&lt;li&gt;LiveSQLBench: 33.79 (#6/33)&lt;/li&gt;&lt;li&gt;AIIQ Composite IQ: 111.0 (#56/138)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen Max&lt;/strong&gt; — ELO 1551&lt;ul&gt;&lt;li&gt;AsyncTool: 25.56 (#6/19)&lt;/li&gt;&lt;li&gt;MixRea: 15.4 (#8/21)&lt;/li&gt;&lt;li&gt;QUIET: 7.62 (#10/12)&lt;/li&gt;&lt;li&gt;FullStackBench en: 55.16 (#15/31)&lt;/li&gt;&lt;li&gt;SuiChat-CN: 68.6 (#20/44)&lt;/li&gt;&lt;li&gt;ACEBench: 0.82 (#26/31)&lt;/li&gt;&lt;li&gt;WritingBench: 66.78 (#49/66)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen Plus&lt;/strong&gt; — ELO 1613&lt;ul&gt;&lt;li&gt;ATC Safety-Oriented Language Understanding Eval: 43.52 (#7/11)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 1.8&lt;/strong&gt; — ELO 1647&lt;ul&gt;&lt;li&gt;Are LLMs Ready to Assist Physicians? PhysAssis: 67.4 (#5/14)&lt;/li&gt;&lt;li&gt;PlanningBench: 22.4 (#12/16)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Seed 2.0 Lite&lt;/strong&gt; — ELO 1639&lt;ul&gt;&lt;li&gt;Beyond Function Calling: 51.3 (#1/12)&lt;/li&gt;&lt;li&gt;Boiling the Frog: 87.2 (#2/9)&lt;/li&gt;&lt;li&gt;PerfCodeBench: 60.19 (#11/20)&lt;/li&gt;&lt;li&gt;ClawProBench: 60.4 (#12/57)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;codestral-2508&lt;/strong&gt; — ELO 1548&lt;ul&gt;&lt;li&gt;ALE-Bench: 137.78 (#79/79)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;deepseek-coder-6.7B-instruct&lt;/strong&gt; — ELO 1340&lt;ul&gt;&lt;li&gt;EvalPlus: 68.45 (#25/25)&lt;/li&gt;&lt;li&gt;RepoQA: 10.6 (#31/33)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;deepseek-llm-7B-chat&lt;/strong&gt; — ELO 1412&lt;ul&gt;&lt;li&gt;MedCTA: 11.0 (#13/18)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;glm-4-9B&lt;/strong&gt; — ELO 1493&lt;ul&gt;&lt;li&gt;EHRBench: 59.62 (#17/31)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;phi-4-14B&lt;/strong&gt; — ELO 1503&lt;ul&gt;&lt;li&gt;When Context Flips, Safety Breaks: 35.9 (#6/12)&lt;/li&gt;&lt;li&gt;TSCG: 0.0 (#13/13)&lt;/li&gt;&lt;li&gt;CardioLens: 36.4 (#24/24)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;qwen3.7-flash&lt;/strong&gt; — ELO 1647&lt;ul&gt;&lt;li&gt;Gert Labs Rankings: 44.71 (#51/93)&lt;/li&gt;&lt;li&gt;Chess Puzzles (Epoch AI): 23.0 (#61/153)&lt;/li&gt;&lt;li&gt;OTIS Mock AIME 2024-25: 86.67 (#65/230)&lt;/li&gt;&lt;li&gt;PM-LLM-Benchmark: 31.5 (#77/170)&lt;/li&gt;&lt;li&gt;SpeechMap Compliance: 28.3 (#341/359)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;uitars-1.5-7B&lt;/strong&gt; — ELO 1469&lt;ul&gt;&lt;li&gt;Beyond Binary: 56.78 (#12/14)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (76)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Arena AI Code: 1630.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Arena AI Document: 1505.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on CAIS Vision Capabilities Index: 62.1 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Creative Writing v3: 2156.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Crosby micro1 RedlineBench: 47.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on EQ-Bench: 2049.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LMArena Text Arena: 1504.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LMArena WebDev Arena: 1629.56 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on OSWorld: 85.96 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on OSWorld-Verified: 85.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on PLawBench: 70.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 98.9 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 96.6 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 98.9 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Tau3-Bench Banking_Knowledge: 39.7 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Chess Puzzles (Epoch AI): 33.0 (#34)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Epoch AI - Mystery Game Puzzles: 37.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on INCLUDE: 89.8 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Lean AI Formalization Leaderboard: 4.0 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on MCP Atlas: 85.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on MILU: 92.1 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OTIS Mock AIME 2024-25: 97.78 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Roboflow Playground OCR: 1212.0 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 94.4 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 96.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 98.9 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Tau3-Bench Banking_Knowledge: 48.7 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on ARC-AGI-1: 94.5 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on ARC-AGI-2: 83.33 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on BilliardPhys-Bench: 72.29 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on CritPt: 30.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on EnigmaEval: 23.82 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on LM Market Cap LMC Score: 91.9 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on MathArena Apex: 69.79 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on MultiNRC: 62.27 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on TaxBench: 27.03 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on TutorBench: 56.62 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on Visual-Language Understanding: 53.89 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on BLXBench: 44.5 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on GDPval-MM: 82.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on LM Market Cap LMC Score: 92.7 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on TaxBench: 29.27 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Pro Sol&lt;/strong&gt; on LM Market Cap LMC Score: 89.0 (#41)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AIIQ Composite IQ: 131.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CAIS Risk Index: 50.8 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CAIS Vision Capabilities Index: 62.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Chess Puzzles (Epoch AI): 7.0 (#123)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Creative Writing v3: 2208.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Critpt: 5.14 (#55)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Korean LLM Eval - CLIcK: 95.5 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Korean LLM Eval - HAE-RAE Bench: 94.64 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Korean LLM Eval - KMMLU-HARD: 85.04 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LM Market Cap LMC Score: 89.0 (#43)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Mercor APEX: 39.9 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on MirrorCode: 20.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OTIS Mock AIME 2024-25: 68.89 (#116)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on PLawBench: 72.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Rogo Big Finance Bench: 53.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 97.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 97.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 100.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Tau3-Bench Banking_Knowledge: 46.9 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Toolathlon: 74.9 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on AA-LCR: 74.7 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on CritPt: 23.4 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Scicode: 58.68 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Vending Bench 2: 5165.04 (#19)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on GameCraft-Bench: 56.96 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on InferenceBench: 5.7 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 93.3 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 92.1 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 97.8 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Sycophancy (Lechmazur): 990990.0 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Tau3-Bench Banking_Knowledge: 37.1 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on TrackingAI IQ Test: 93.75 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on TrackingAI IQ Test (Vision): 88.0 (#4)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (79)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LMArena WebDev Arena&lt;/strong&gt;: Kimi K3 (1682.01) beat Claude Opus 4.7 by 114.16&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Arena AI Code&lt;/strong&gt;: Kimi K3 (1682.0) beat Claude Opus 4.7 by 112.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;USAMO25&lt;/strong&gt;: Claude Mythos Preview (97.6) beat DeepSeek R1 0528 by 67.54&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Natural2Code&lt;/strong&gt;: Gemini 2.0 Flash (92.9) beat GPT-4 by 40.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Game Dev)&lt;/strong&gt;: Claude Opus 5 (1426.0) beat Claude Fable 5 by 32.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AutoLogi&lt;/strong&gt;: Kimi K2 (89.5) beat GPT-4o (2024-08-06) by 27.46&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TIR-Bench&lt;/strong&gt;: Qwen 3.6 Plus (61.6) beat o4-mini (Tool Use) by 24.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OJBench&lt;/strong&gt;: Kimi K2.6 (60.6) beat Gemini 2.5 Pro (Preview 03-25) by 21.69&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Toolathlon&lt;/strong&gt;: Claude Opus 5 (80.6) beat Claude Fable 5 by 18.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMOU&lt;/strong&gt;: Gemini 3.1 Pro (Preview) (82.67) beat Gemini 2.5 Pro by 18.47&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Tau3 Banking&lt;/strong&gt;: Qwen 3.8 Max (51.34) beat Kimi K3 (Low) by 17.32&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GDPval-MM&lt;/strong&gt;: GPT-5.5 (84.9) beat GPT-5.2 by 14.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (SVG)&lt;/strong&gt;: GPT-5.6 Sol (1362.0) beat Claude Fable 5 by 14.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - KMMLU-HARD&lt;/strong&gt;: Claude Opus 5 (reasoning=medium) (88.4) beat GPT-5.2 (Medium) by 13.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ArxivMath&lt;/strong&gt;: Claude Opus 5 (91.33) beat Claude Fable 5 by 12.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LMArena Text Arena&lt;/strong&gt;: Claude Opus 4.6 (Thinking) (1512.42) beat Claude Opus 4.6 by 12.18&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AudioMC&lt;/strong&gt;: Gemini 3.1 Pro (Preview) (High) (66.8) beat Gemini 3 by 12.15&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (SkillsBench)&lt;/strong&gt;: Qwen 3.8 Max (70.2) beat Qwen 3.7 Max by 11.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Tau3-Bench Banking_Knowledge&lt;/strong&gt;: Qwen 3.8 Max (55.2) beat GPT-5.5 by 8.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MirrorCode&lt;/strong&gt;: Claude Fable 5 (63.9) beat Claude Opus 4.7 by 7.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Long Context Reasoning&lt;/strong&gt;: Muse Spark 1.2 (xHigh) (83.33) beat GPT-5.2 Codex (xHigh) by 7.66&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FrontierCode&lt;/strong&gt;: Claude Opus 5 (53.4) beat Claude Fable 5 (xHigh) by 7.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Data Viz)&lt;/strong&gt;: Claude Opus 5 (1389.0) beat Kimi K3 by 7.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ZeroBench&lt;/strong&gt;: GPT-5.6 Sol (Max) (30.0) beat Claude Fable 5 (Max) by 7.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (NL2Repo)&lt;/strong&gt;: Qwen 3.8 Max (55.9) beat GLM-5.2 by 7.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Harvey Legal Agent Benchmark&lt;/strong&gt;: Claude Opus 5 (23.58) beat Claude Mythos 5 by 6.67&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE Atlas - Test Writing&lt;/strong&gt;: Claude Opus 5 (Claude Code) xHigh (62.22) beat Claude Fable 5 (Claude Code) xHigh by 6.62&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMAU&lt;/strong&gt;: Gemini 3.1 Pro (Preview) (High) (82.5) beat Audio-Thinker by 6.52&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMEB Leaderboard&lt;/strong&gt;: Tianmu-Emb-Uni (52.83) beat e5-omni-7B by 6.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE Atlas - Codebase QnA&lt;/strong&gt;: Claude Opus 5 (Claude Code) xHigh (63.17) beat Claude Opus 4.8 (Claude Code) xhigh by 5.91&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (ERQA)&lt;/strong&gt;: Qwen 3.8 Max (77.8) beat Seed 2.1 Pro by 5.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL Showdown&lt;/strong&gt;: Gemini 3 Pro (Preview) (1266.5) beat GPT-4o Audio (Preview 2025-06-03) by 5.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CAIS Risk Index&lt;/strong&gt;: Claude Fable 5 (27.3) beat Claude Opus 4.7 by 5.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Harvey Legal Agent Bench&lt;/strong&gt;: Muse Spark 1.2 (xHigh) (25.42) beat Muse Spark 1.1 by 5.42&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ZEROBench-Sub&lt;/strong&gt;: Qwen 3.5 122B A10B (36.2) beat Seed1.5-VL (Thinking) by 5.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - CLIcK&lt;/strong&gt;: Claude Opus 5 (reasoning=medium) (95.84) beat GPT-5.2 (Medium) by 4.92&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MCP Atlas&lt;/strong&gt;: Muse Spark 1.1 (xHigh) (88.1) beat Gemini 3.5 Flash by 4.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ComplexFuncBench&lt;/strong&gt;: GPT-4.1 (65.5) beat Claude 3.5 Sonnet by 4.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMVU&lt;/strong&gt;: Kimi K2.5 (80.4) beat O1 by 4.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Graphwalks BFS 256k F1&lt;/strong&gt;: GPT-5.6 Sol (95.4) beat Claude Mythos 5 by 4.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VideoMME w/o sub.&lt;/strong&gt;: Qwen 3.5 122B A10B (83.9) beat Video-SALMONN 2 by 4.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - HAE-RAE Bench&lt;/strong&gt;: Claude Opus 5 (reasoning=medium) (95.84) beat GPT-5.2 (Medium) by 4.03&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Graphwalks BFS 1M F1&lt;/strong&gt;: GPT-5.6 Sol (83.4) beat Claude Mythos 5 by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - Julia&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (92.0) beat GPT-5.4 (Low) by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MyPCBench&lt;/strong&gt;: Claude Opus 4.8 (62.0) beat Claude Opus 4.6 by 3.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (LVBench)&lt;/strong&gt;: Qwen 3.8 Max (81.8) beat Seed 2.1 Pro by 3.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PLawBench&lt;/strong&gt;: Qwen 3.8 Max (73.2) beat GPT-5.2 by 3.53&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WritingBench&lt;/strong&gt;: Qwen 3 Next 80B A3B Instruct (87.3) beat GPT-5 by 3.43&lt;/li&gt;&lt;li&gt;&lt;strong&gt;When Lower Privileges Suffice&lt;/strong&gt;: Qwen 3 8B (64.9) beat Qwen 3 8B by 3.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (LongBench v2)&lt;/strong&gt;: Qwen 3.8 Max (66.3) beat Qwen 3.5 397B A17B by 3.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Health&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (53.72) beat GPT-5.6 Sol (High) by 3.02&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - C&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (95.0) beat GPT-5.5 (High) by 3.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TrackingAI IQ Test (Mensa Norway)&lt;/strong&gt;: GPT-5.6 Sol (Ultra) (100.0) beat GPT-5 Pro by 2.86&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProteinGym Hard&lt;/strong&gt;: Claude Opus 5 (47.7) beat Claude Mythos 5 by 2.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (VideoMME w sub.)&lt;/strong&gt;: Qwen 3.8 Max (90.4) beat Qwen 3.6 27B by 2.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Spider 2.0-Lite&lt;/strong&gt;: GLM-5.2 (76.23) beat ktx by 2.56&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Software Engineering (SWE) - TypeScript&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (94.44) beat GPT-5.6 Sol (Max) by 2.22&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (HealthBench)&lt;/strong&gt;: Qwen 3.8 Max (60.2) beat Kimi K2 (0905) (Thinking) by 2.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Finance Agent v2&lt;/strong&gt;: Muse Spark 1.2 (xHigh) (60.6) beat Claude Opus 5 by 1.97&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TrackingAI IQ Test&lt;/strong&gt;: GPT-5.6 Sol (Ultra) (98.04) beat GPT-5 Pro by 1.96&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AA Omniscience - Law&lt;/strong&gt;: Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (66.2) beat Gemini 3 Pro (Preview) (High) by 1.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PhiBench&lt;/strong&gt;: Phi-4-reasoning-plus (Thinking) (74.2) beat GPT-4o by 1.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SWE-rebench&lt;/strong&gt;: Claude Fable 5 (High) (64.5) beat GPT-5.5 (xHigh) by 1.77&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CritPt&lt;/strong&gt;: GPT-5.6 Sol (Max) (32.3) beat GPT-5.5 Pro by 1.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;IMO-AnswerBench&lt;/strong&gt;: Nemotron 3 Ultra (92.3) beat DeepSeek V4 Flash by 1.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (OSWorld-Verified)&lt;/strong&gt;: Qwen 3.8 Max (86.1) beat Claude Fable 5 by 1.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LLM Stats (RealWorldQA)&lt;/strong&gt;: Qwen 3.8 Max (88.0) beat Qwen 3.7 Plus by 1.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Time Horizon Index&lt;/strong&gt;: Claude Opus 5 (Max) (13.67) beat GPT-5.6 Sol by 0.67&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI TaxEval v2&lt;/strong&gt;: Muse Spark 1.2 (xHigh) (80.38) beat Muse Spark 1.1 by 0.66&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSearchQA&lt;/strong&gt;: Kimi K3 (Max) (95.0) beat Claude Mythos Preview by 0.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LVBench&lt;/strong&gt;: Seed 2.1 Pro (78.0) beat GPT-5.4 by 0.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ARC-AGI-1&lt;/strong&gt;: Claude Fable 5 (Max) (98.5) beat Human Panel by 0.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MedScribe&lt;/strong&gt;: Muse Spark 1.1 (xHigh) (88.89) beat Claude Fable 5 (Max) by 0.37&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Deep20Bench&lt;/strong&gt;: Claude Fable 5 (High) (12.06) beat Claude Opus 5 (High) by 0.28&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ForecastBench&lt;/strong&gt;: captain-jack (68.9) beat Cassi-2026-05-10 by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Agent Arena - Tool Hallucination&lt;/strong&gt;: Gemini 3 Flash (0.01) beat Nemotron 3 Ultra by 0.18&lt;/li&gt;&lt;li&gt;&lt;strong&gt;InferenceBench&lt;/strong&gt;: Claude Opus 5 (8.9) beat Claude Fable 5 (Low) by 0.16&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MRCR-v2 128k&lt;/strong&gt;: Gemini 3.6 Flash (91.8) beat Qwen 3.7 Plus by 0.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProphetArena&lt;/strong&gt;: Gemini 3.6 Flash (0.9638) beat Gemini 3.1 Pro (Preview) by 0.01&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-09

=== DAILY ===
NEW BENCHMARKS (4)
  - Coarena (Elo (Bradley-Terry)): leader Claude Fable 5 (1079.1), 13 models
  - Coarena - Task Completion (Completion Rate (%)): leader GPT-5.6 Terra (81.4), 13 models
  - Featherbench (Pass Rate (%)): leader Gemini 3.6 Flash (96.0</summary></entry><entry><title>The Aggregate Digest — 2026-08-08</title><id>https://theaggregate.ai/digest/2026-08-08</id><updated>2026-08-08T04:40:31.488512+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (7)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - CLIcK&lt;/strong&gt; (Accuracy (%, 0-shot)): leader Claude Opus 5 (reasoning=medium) (95.84), 8 models&lt;br&gt;&lt;span&gt;daekeun-ml Korean proficiency suite on CLIcK (Cultural and Linguistic Intelligence in Korean): overall accuracy %, 0-shot, culture and language categories.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - HAE-RAE Bench&lt;/strong&gt; (Accuracy (%, 0-shot)): leader Claude Opus 5 (reasoning=medium) (95.84), 8 models&lt;br&gt;&lt;span&gt;daekeun-ml Korean proficiency suite on HAE_RAE_BENCH 1.0: overall accuracy % across general knowledge, history, loan/rare words, reading comprehension and nomenclature, 0-shot.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - KoBALT-700&lt;/strong&gt; (Accuracy (%, 0-shot)): leader Claude Opus 5 (reasoning=medium) (88.14), 8 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - KMMLU-HARD&lt;/strong&gt; (Accuracy (%, 0-shot)): leader Claude Opus 5 (reasoning=medium) (88.4), 8 models&lt;br&gt;&lt;span&gt;daekeun-ml Korean proficiency suite on the KMMLU-HARD subset: overall accuracy % on the hardest KMMLU questions, 0-shot.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - KMMLU-Pro&lt;/strong&gt; (Accuracy (%, 0-shot)): leader Claude Opus 5 (reasoning=medium) (95.64), 8 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Korean LLM Eval - MuSR (Ko)&lt;/strong&gt; (Accuracy (%, 0-shot)): leader Claude Opus 5 (reasoning=medium) (86.53), 8 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MIST (Selective Trust)&lt;/strong&gt; (Overall Accuracy (%)): leader Gemini 3.1 Pro (Preview) (94.2), 23 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on OSWorld: 85.96 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on ARC-AGI-1: 94.5 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on ARC-AGI-2: 83.33 (#15)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (2)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Game Dev)&lt;/strong&gt;: Claude Opus 5 (1444.0) beat Claude Fable 5 by 48.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ZeroBench&lt;/strong&gt;: GPT-5.6 Sol (Max) (30.0) beat Claude Fable 5 (Max) by 7.0&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-08

=== DAILY ===
NEW BENCHMARKS (7)
  - Korean LLM Eval - CLIcK (Accuracy (%, 0-shot)): leader Claude Opus 5 (reasoning=medium) (95.84), 8 models
      daekeun-ml Korean proficiency suite on CLIcK (Cultural and Linguistic Intelligence in Korean): overall accuracy %, 0</summary></entry><entry><title>The Aggregate Digest — 2026-08-07</title><id>https://theaggregate.ai/digest/2026-08-07</id><updated>2026-08-07T05:41:54.632016+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (4)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SciCode-Verified&lt;/strong&gt; (Subproblem Resolve Rate (%)): leader Gemini 3.5 Flash (97.2), 4 models&lt;br&gt;&lt;span&gt;SciCode regraded after its benchmark defects were removed: the same 64 research-level scientific-coding problems (287 subproblems), rerun on a cleaned dataset with a corrected grading layer. The authors&amp;#x27; point is the size of the correction — the frontier moves from roughly 50–58% subproblem accuracy on the original grading to 84–97% here, so the original board understated scientific coding rather than measuring its limit.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BoundaryBench (Unrestricted)&lt;/strong&gt; (Success Rate (%)): leader GPT-5.6 Sol (83.9), 13 models&lt;br&gt;&lt;span&gt;BoundaryBench runs coding agents over Terminal-Bench 2.1&amp;#x27;s 89 tasks with no sandbox restrictions, three trials per configuration. This is the control arm: each model is scored under its native harness (Claude Code, Codex, Grok Build or Terminus 2) with full filesystem and network access.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BoundaryBench (NIST High)&lt;/strong&gt; (Success Rate under NIST high policy (%)): leader Grok 4.5 (74.9), 13 models&lt;br&gt;&lt;span&gt;BoundaryBench under the NIST-high least-privilege policy: the same Terminal-Bench 2.1 tasks and harnesses, but the agent runs inside a sandbox that enforces restrictive authorization. Measures how much capability survives real deployment constraints — every model loses ground, and the size of the drop is the benchmark\&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CEO-Bench - Max Survival Days&lt;/strong&gt; (Max survival days (self-reported)): leader Claude Opus 4.8 (500.0), 10 models&lt;br&gt;&lt;span&gt;CEO-Bench longevity slice: how many simulated days an agent keeps the company solvent at its best run, rather than the cash it ends with. Reported by the benchmark authors.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Nemotron 3 Ultra 550B A55B&lt;/strong&gt; — ELO 1659, #85&lt;ul&gt;&lt;li&gt;Vals Index: 43.99 (#27/35)&lt;/li&gt;&lt;li&gt;Finance Agent v2: 37.67 (#31/39)&lt;/li&gt;&lt;li&gt;MedCode: 38.62 (#36/63)&lt;/li&gt;&lt;li&gt;ProofBench: 2.0 (#47/49)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (60)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Arena AI Code: 1630.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Arena AI Document: 1505.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on CAIS Vision Capabilities Index: 62.1 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Creative Writing v3: 2156.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Crosby micro1 RedlineBench: 47.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on EQ-Bench: 2049.7 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LMArena Text Arena: 1504.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on LMArena WebDev Arena: 1629.56 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on OSWorld-Verified: 85.0 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on PLawBench: 70.2 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Chess Puzzles (Epoch AI): 33.0 (#34)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Epoch AI - Mystery Game Puzzles: 37.0 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on INCLUDE: 89.8 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on MCP Atlas: 85.8 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on MILU: 92.1 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on OTIS Mock AIME 2024-25: 97.78 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Roboflow Playground OCR: 1212.0 (#17)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on BilliardPhys-Bench: 72.29 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on CritPt: 30.0 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on EnigmaEval: 23.82 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on LM Market Cap LMC Score: 91.9 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on MathArena Apex: 69.79 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on MultiNRC: 62.27 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on TaxBench: 27.03 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on TutorBench: 56.62 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.4 Pro&lt;/strong&gt; on Visual-Language Understanding: 53.89 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on BLXBench: 44.5 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on GDPval-MM: 82.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on LM Market Cap LMC Score: 92.7 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.5 Pro&lt;/strong&gt; on TaxBench: 29.27 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Pro Sol&lt;/strong&gt; on LM Market Cap LMC Score: 89.0 (#41)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on AIIQ Composite IQ: 131.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CAIS Risk Index: 50.8 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on CAIS Vision Capabilities Index: 62.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Chess Puzzles (Epoch AI): 7.0 (#115)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Creative Writing v3: 2208.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on LM Market Cap LMC Score: 89.0 (#43)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on OTIS Mock AIME 2024-25: 68.89 (#108)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on PLawBench: 72.3 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Rogo Big Finance Bench: 53.0 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Toolathlon: 74.9 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on MineBench: 1267.73 (#30)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on NL2Repo: 55.9 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on Toolathlon: 72.5 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on ErdosBench: 2.73 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI Excel Modeling: 56.98 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI Legal Research Bench: 43.75 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI LegalBench: 85.26 (#16)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI MMLU-Pro: 88.28 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI MMMU: 86.13 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI MedCode: 49.35 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI MedScribe: 90.06 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI MortgageTax: 65.42 (#41)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI Multimodal Index: 69.8 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI ProofBench: 57.0 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI Public Benefits Bench: 68.47 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI SAGE: 47.66 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI SWE-bench Verified: 86.6 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI SkillsBench: 53.04 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;muse-spark-1.2&lt;/strong&gt; on Vals AI Vibe Code Bench: 79.1 (#7)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (36)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;LMArena WebDev Arena&lt;/strong&gt;: Kimi K3 (1682.01) beat Claude Opus 4.7 by 114.16&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Arena AI Code&lt;/strong&gt;: Kimi K3 (1682.0) beat Claude Opus 4.7 by 112.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;USAMO25&lt;/strong&gt;: Claude Mythos Preview (97.6) beat DeepSeek R1 0528 by 67.54&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Natural2Code&lt;/strong&gt;: Gemini 2.0 Flash (92.9) beat GPT-4 by 40.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AutoLogi&lt;/strong&gt;: Kimi K2 (89.5) beat GPT-4o (2024-08-06) by 27.46&lt;/li&gt;&lt;li&gt;&lt;strong&gt;TIR-Bench&lt;/strong&gt;: Qwen 3.6 Plus (61.6) beat o4-mini (Tool Use) by 24.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OJBench&lt;/strong&gt;: Kimi K2.6 (60.6) beat Gemini 2.5 Pro (Preview 03-25) by 21.69&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Toolathlon&lt;/strong&gt;: Claude Opus 5 (80.6) beat Claude Fable 5 by 18.9&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GDPval-MM&lt;/strong&gt;: GPT-5.5 (84.9) beat GPT-5.2 by 14.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ArxivMath&lt;/strong&gt;: Claude Opus 5 (91.33) beat Claude Fable 5 by 12.73&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LMArena Text Arena&lt;/strong&gt;: Claude Opus 4.6 (Thinking) (1512.42) beat Claude Opus 4.6 by 12.18&lt;/li&gt;&lt;li&gt;&lt;strong&gt;AudioMC&lt;/strong&gt;: Gemini 3.1 Pro (Preview) (High) (66.8) beat Gemini 3 by 12.15&lt;/li&gt;&lt;li&gt;&lt;strong&gt;FrontierCode&lt;/strong&gt;: Claude Opus 5 (53.4) beat Claude Fable 5 (xHigh) by 7.1&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Harvey Legal Agent Benchmark&lt;/strong&gt;: Claude Opus 5 (23.58) beat Claude Mythos 5 by 6.67&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMAU&lt;/strong&gt;: Gemini 3.1 Pro (Preview) (High) (82.5) beat Audio-Thinker by 6.52&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CAIS Risk Index&lt;/strong&gt;: Claude Fable 5 (27.3) beat Claude Opus 4.7 by 5.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Harvey Legal Agent Bench&lt;/strong&gt;: muse-spark-1.2 (25.42) beat Muse Spark 1.1 by 5.42&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ZEROBench-Sub&lt;/strong&gt;: Qwen 3.5 122B A10B (36.2) beat Seed1.5-VL (Thinking) by 5.4&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MCP Atlas&lt;/strong&gt;: Muse Spark 1.1 (xHigh) (88.1) beat Gemini 3.5 Flash by 4.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ComplexFuncBench&lt;/strong&gt;: GPT-4.1 (65.5) beat Claude 3.5 Sonnet by 4.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMVU&lt;/strong&gt;: Kimi K2.5 (80.4) beat O1 by 4.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Graphwalks BFS 256k F1&lt;/strong&gt;: GPT-5.6 Sol (95.4) beat Claude Mythos 5 by 4.3&lt;/li&gt;&lt;li&gt;&lt;strong&gt;VideoMME w/o sub.&lt;/strong&gt;: Qwen 3.5 122B A10B (83.9) beat Video-SALMONN 2 by 4.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Graphwalks BFS 1M F1&lt;/strong&gt;: GPT-5.6 Sol (83.4) beat Claude Mythos 5 by 4.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PLawBench&lt;/strong&gt;: Qwen 3.8 Max (73.2) beat GPT-5.2 by 3.53&lt;/li&gt;&lt;li&gt;&lt;strong&gt;WritingBench&lt;/strong&gt;: Qwen 3 Next 80B A3B Instruct (87.3) beat GPT-5 by 3.43&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ProteinGym Hard&lt;/strong&gt;: Claude Opus 5 (47.7) beat Claude Mythos 5 by 2.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Finance Agent v2&lt;/strong&gt;: muse-spark-1.2 (60.6) beat Claude Opus 5 by 1.97&lt;/li&gt;&lt;li&gt;&lt;strong&gt;PhiBench&lt;/strong&gt;: Phi-4-reasoning-plus (Thinking) (74.2) beat GPT-4o by 1.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;CritPt&lt;/strong&gt;: GPT-5.6 Sol (Max) (32.3) beat GPT-5.5 Pro by 1.7&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI TaxEval v2&lt;/strong&gt;: muse-spark-1.2 (80.38) beat Muse Spark 1.1 by 0.66&lt;/li&gt;&lt;li&gt;&lt;strong&gt;DeepSearchQA&lt;/strong&gt;: Kimi K3 (Max) (95.0) beat Claude Mythos Preview by 0.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;LVBench&lt;/strong&gt;: Seed 2.1 Pro (78.0) beat GPT-5.4 by 0.6&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MedScribe&lt;/strong&gt;: Muse Spark 1.1 (xHigh) (88.89) beat Claude Fable 5 (Max) by 0.37&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMEB Leaderboard&lt;/strong&gt;: Tianmu-Emb-Uni (52.83) beat Ovis-Omni-Embedding-v0.1-3B by 0.28&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MRCR-v2 128k&lt;/strong&gt;: Gemini 3.6 Flash (91.8) beat Qwen 3.7 Plus by 0.1&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-07

=== DAILY ===
NEW BENCHMARKS (4)
  - SciCode-Verified (Subproblem Resolve Rate (%)): leader Gemini 3.5 Flash (97.2), 4 models
      SciCode regraded after its benchmark defects were removed: the same 64 research-level scientific-coding problems (287 subproblems), r</summary></entry><entry><title>The Aggregate Digest — 2026-08-06</title><id>https://theaggregate.ai/digest/2026-08-06</id><updated>2026-08-06T06:15:17.632202+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (11)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;SWE-Touch&lt;/strong&gt; (Counter-Edit Resolve Rate (%)): leader Claude Opus 4.8 (83.3), 9 models&lt;br&gt;&lt;span&gt;SWE-Touch — tests whether a coding agent can still finish a repair after the user directly edits the code in the shared workspace mid-task. Counter-Edit resolve rate (%) on SWE-bench Verified: the same tasks as the agent&amp;#x27;s autonomous (Vanilla) run, but with a conflicting user commit landing during the run, which costs the 9 evaluated models a mean 7.7 points.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Computer Anthology Terminal Tasks (Claude Code)&lt;/strong&gt; (pass@1 (%)): leader Claude Opus 5 (54.0), 4 models&lt;br&gt;&lt;span&gt;Vetto&amp;#x27;s Computer Anthology Terminal Tasks v1.0 run under the Claude Code agent scaffold — 100 held-out terminal jobs graded by per-task sandboxed verifiers; pass@1 over 5 trials per task. Reported per model+scaffold pair because the scaffold moves the score substantially.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Computer Anthology Terminal Tasks (Codex CLI)&lt;/strong&gt; (pass@1 (%)): leader GPT-5.6 Sol (58.0), 4 models&lt;br&gt;&lt;span&gt;Vetto&amp;#x27;s Computer Anthology Terminal Tasks v1.0 run under the Codex CLI agent scaffold — 100 held-out terminal jobs graded by per-task sandboxed verifiers; pass@1 over 5 trials per task. Reported per model+scaffold pair because the scaffold moves the score substantially.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Computer Anthology Terminal Tasks (Terminus-2)&lt;/strong&gt; (pass@1 (%)): leader Claude Opus 5 (61.8), 18 models&lt;br&gt;&lt;span&gt;Vetto&amp;#x27;s Computer Anthology Terminal Tasks v1.0 — 100 held-out terminal jobs across 17 categories and 11 runtimes, weighted toward data science, ML, optimization and model training, each graded by its own sandboxed verifier (no LLM judge). This slice runs every model under the Terminus-2 scaffold; pass@1 over 5 trials per task.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Arena&lt;/strong&gt; (Confidence-weighted Elo): leader Claude Fable 5 (1005.3), 28 models&lt;br&gt;&lt;span&gt;Head-to-head coding arena: one unified confidence-weighted Elo ladder over seven task domains (reasoning, hallucination, security, refactoring, debugging, spec conformance, bullshit), decided by seeded blind matches judged 3-of-7 by a vendor-disjoint model panel. Domain filters slice the same match record rather than forming separate ladders.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenRouter GPQA Diamond&lt;/strong&gt; (Accuracy (%)): leader Gemini 3.1 Pro (Preview) (94.3), 105 models&lt;br&gt;&lt;span&gt;OpenRouter&amp;#x27;s own GPQA Diamond run: 198 graduate-level science questions executed by its native benchmark harness against the production endpoints it serves, so the score reflects the deployed model rather than a vendor-reported figure.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenRouter Tau2-Bench Airline&lt;/strong&gt; (Accuracy (%)): leader Claude Fable 5 (82.0), 108 models&lt;br&gt;&lt;span&gt;OpenRouter&amp;#x27;s own τ²-Bench Airline run: 50 multi-turn airline customer-service tasks where the model must use tools and follow policy, executed against the production endpoints it serves.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenRouter HLE (Search)&lt;/strong&gt; (Best-configuration Accuracy (%)): leader Claude Opus 5 (72.7), 3 models&lt;br&gt;&lt;span&gt;OpenRouter&amp;#x27;s Humanity&amp;#x27;s Last Exam run with web search: 2,158 expert-written questions answered through a search provider (Exa, Perplexity, Parallel, or the OpenAI/Anthropic native tools) under a 1, 5, or 25-turn budget. The board varies the search stack rather than the model, so each model is scored on its best configuration.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenRouter BrowseComp (Search)&lt;/strong&gt; (Best-configuration Accuracy (%)): leader GPT-5.6 Sol (75.0), 3 models&lt;br&gt;&lt;span&gt;OpenRouter&amp;#x27;s BrowseComp run: 1,266 questions built to be unfindable in a single search, rewarding persistent multi-step browsing. Scored across search providers and turn budgets; each model takes its best configuration.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenRouter DeepSearchQA (Search)&lt;/strong&gt; (Best-configuration Accuracy (%)): leader GPT-5.6 Sol (77.0), 2 models&lt;br&gt;&lt;span&gt;OpenRouter&amp;#x27;s DeepSearchQA run: research questions answered through a live search provider, graded by answer equivalence against a reference. Scored across search providers and turn budgets; each model takes its best configuration.&lt;/span&gt;&lt;/li&gt;&lt;li&gt;&lt;strong&gt;OpenRouter WideSearch (Search)&lt;/strong&gt; (Best-configuration Exact Table Match (%)): leader GPT-5.6 Sol (15.0), 2 models&lt;br&gt;&lt;span&gt;OpenRouter&amp;#x27;s WideSearch run: the model must assemble a complete reference table from the open web, scored strictly — credit only when every required row and cell matches. Scored across search providers and turn budgets; each model takes its best configuration.&lt;/span&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New Models (1)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Muse Spark 1.2&lt;/strong&gt; — ELO 1727&lt;ul&gt;&lt;li&gt;BenchLM: 60.2 (#49/200)&lt;/li&gt;&lt;li&gt;LM Market Cap LMC Score: 80.6 (#55/346)&lt;/li&gt;&lt;/ul&gt;&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (36)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on Tau3-Bench Banking_Knowledge: 39.7 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Lean AI Formalization Leaderboard: 3.0 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on Tau3-Bench Banking_Knowledge: 48.7 (#2)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Epoch AI - Mystery Game Puzzles: 49.0 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Tau3-Bench Banking_Knowledge: 46.9 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Tau3-Bench Banking_Knowledge: 37.1 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA CritPt: 20.0 (#22)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA GDPval: 1738.53 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA GPQA Diamond: 92.73 (#14)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Humanity's Last Exam: 41.38 (#18)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Long Context Reasoning: 66.67 (#74)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA MMMU-Pro: 82.31 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience: 4.08 (#51)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Business: 24.2 (#119)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Health: 30.4 (#90)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Humanities &amp; Social Sciences: 30.3 (#100)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Law: 20.4 (#117)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Science, Engineering &amp; Mathematics: 37.8 (#92)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE): 45.4 (#91)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - C: 62.0 (#98)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Dart: 34.0 (#105)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Go: 32.0 (#112)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - HTML: 50.0 (#98)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Java: 30.0 (#101)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - JavaScript: 60.0 (#61)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Julia: 16.0 (#198)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Kotlin: 24.0 (#167)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - PHP: 38.0 (#134)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Python: 43.5 (#86)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - R: 24.0 (#135)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Rust: 70.0 (#75)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - Swift: 72.0 (#47)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA Omniscience - Software Engineering (SWE) - TypeScript: 56.67 (#73)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA SciCode: 52.89 (#29)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AA-Omniscience Accuracy: 31.42 (#96)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on Artificial Analysis Intelligence Index: 56.22 (#9)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (5)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Tau3-Bench Banking_Knowledge&lt;/strong&gt;: Qwen 3.8 Max (55.2) beat GPT-5.5 by 8.8&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Tau3 Banking&lt;/strong&gt;: Qwen 3.8 Max (42.47) beat Kimi K3 (Low) by 8.45&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Vals AI Time Horizon Index&lt;/strong&gt;: Claude Opus 5 (13.67) beat GPT-5.6 Sol by 0.67&lt;/li&gt;&lt;li&gt;&lt;strong&gt;ARC-AGI-1&lt;/strong&gt;: Claude Fable 5 (Max) (98.5) beat Human Panel by 0.5&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Deep20Bench&lt;/strong&gt;: Claude Fable 5 (High) (12.06) beat Claude Opus 5 (High) by 0.28&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-06

=== DAILY ===
NEW BENCHMARKS (11)
  - SWE-Touch (Counter-Edit Resolve Rate (%)): leader Claude Opus 4.8 (83.3), 9 models
      SWE-Touch — tests whether a coding agent can still finish a repair after the user directly edits the code in the shared workspace mid-task</summary></entry><entry><title>The Aggregate Digest — 2026-08-05</title><id>https://theaggregate.ai/digest/2026-08-05</id><updated>2026-08-05T06:12:14.928861+00:00</updated><link href="https://theaggregate.ai/whats-new?ref=atom" /><author><name>The Aggregate</name></author><content type="html">&lt;h2&gt;Daily&lt;/h2&gt;
&lt;h3&gt;New Benchmarks (3)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;QuantCodeEval (Claude Code)&lt;/strong&gt; (Full Pass Rate (%)): leader Claude Opus 5 (31.33), 3 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;QuantCodeEval (Codex CLI)&lt;/strong&gt; (Full Pass Rate (%)): leader GPT-5.6 Sol (27.33), 2 models&lt;/li&gt;&lt;li&gt;&lt;strong&gt;QuantCodeEval (OpenCode)&lt;/strong&gt; (Full Pass Rate (%)): leader Kimi K3 (26.0), 11 models&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;Top-10 New Scores (29)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 98.9 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 96.6 (#6)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Fable 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 98.9 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on BridgeBench Debugging: 1001.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on BridgeBench Hallucination: 1001.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on BridgeBench Refactoring: 1001.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on BridgeBench Security: 1001.5 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 94.4 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 96.6 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Claude Opus 5&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 98.9 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on Mercor APEX: 39.9 (#7)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 97.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 97.8 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;GPT-5.6 Sol&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 100.0 (#1)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on Epoch AI - Scicode: 58.68 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on GameCraft-Bench: 56.96 (#3)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (C#): 93.3 (#9)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (Rust): 92.1 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on SpacetimeDB LLM Benchmark (TypeScript): 97.8 (#10)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on TrackingAI IQ Test: 93.75 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Kimi K3&lt;/strong&gt; on TrackingAI IQ Test (Vision): 88.0 (#4)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AI Chess Leaderboard (Continuation): 1165.0 (#31)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on AI Chess Leaderboard (Reasoning): 1521.0 (#20)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on DeepSWE: 57.5 (#12)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on KernelBench Hub - CUDA: 28.48 (#5)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on KernelBench Hub - Hard: 33.89 (#8)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on Multi-turn Debate (Lechmazur): 1587.5 (#11)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on NYT Connections Extended: 88.9 (#15)&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Qwen 3.8 Max&lt;/strong&gt; on Vals AI Vibe Code Bench: 64.7 (#17)&lt;/li&gt;&lt;/ul&gt;
&lt;h3&gt;New #1 Leaders (9)&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;strong&gt;MMOU&lt;/strong&gt;: Gemini 3.1 Pro (Preview) (82.67) beat Gemini 2.5 Pro by 18.47&lt;/li&gt;&lt;li&gt;&lt;strong&gt;Design Arena (Video Editing)&lt;/strong&gt;: minimax-h3 (1395.0) beat Gemini 2.0 Flash by 14.0&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE Atlas - Test Writing&lt;/strong&gt;: Claude Opus 5 (Claude Code) xHigh (62.22) beat Claude Fable 5 (Claude Code) xHigh by 6.62&lt;/li&gt;&lt;li&gt;&lt;strong&gt;MMEB Leaderboard&lt;/strong&gt;: Ovis-Omni-Embedding-v0.1-3B (52.55) beat e5-omni-7B by 6.02&lt;/li&gt;&lt;li&gt;&lt;strong&gt;SEAL - SWE Atlas - Codebase QnA&lt;/strong&gt;: Claude Opus 5 (Claude Code) xHigh (63.17) beat Claude Opus 4.8 (Claude Code) xhigh by 5.91&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Security&lt;/strong&gt;: Claude Fable 5 (1005.3) beat GPT-5.6 Sol by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Debugging&lt;/strong&gt;: Claude Fable 5 (1005.3) beat GPT-5.6 Sol by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Refactoring&lt;/strong&gt;: Claude Fable 5 (1005.3) beat GPT-5.6 Sol by 0.2&lt;/li&gt;&lt;li&gt;&lt;strong&gt;BridgeBench Hallucination&lt;/strong&gt;: Claude Fable 5 (1005.3) beat GPT-5.6 Sol by 0.2&lt;/li&gt;&lt;/ul&gt;</content><summary>The Aggregate Digest — 2026-08-05

=== DAILY ===
NEW BENCHMARKS (3)
  - QuantCodeEval (Claude Code) (Full Pass Rate (%)): leader Claude Opus 5 (31.33), 3 models
  - QuantCodeEval (Codex CLI) (Full Pass Rate (%)): leader GPT-5.6 Sol (27.33), 2 models
  - QuantCodeEval (OpenCode) (Full Pass Rate (%)):</summary></entry></feed>