SpacetimeDB LLM Benchmark (Rust) — leaderboard

Rust subset of the SpacetimeDB LLM Benchmark. Tests LLM ability to generate correct SpacetimeDB Rust module code, evaluating basics (reducers, tables, CRUD) and schema patterns against live module execution.

Metric: Task Pass Rate (%). Source: spacetimedb.com. Status: saturated. 10 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.6100
2Claude Opus 4.6100
3Gemini 3 Flash97.7
4GPT-5 Mini94.7
5Grok 490.9
6GPT-5.2 Codex90.9
7DeepSeek V3 Chat83.6
8Gemini 3.1 Pro (Preview)77.3
9DeepSeek Reasoner53.3

Interactive version: theaggregate.ai/benchmark?slug=spacetimedb-llm-benchmark-rust · How the rankings work · Data refreshed daily, snapshot 2026-07-22.