SpacetimeDB LLM Benchmark (Rust): leaderboard

Rust subset of the SpacetimeDB LLM Benchmark. Tests LLM ability to generate correct SpacetimeDB Rust module code, evaluating basics (reducers, tables, CRUD) and schema patterns against live module execution.

Metric: Eval Pass Rate (%). Source: spacetimedb.com. Status: saturation imminent. 14 models tracked.

Top models

#ModelScore
1Grok 4.397.8
2Grok Build 0.197.8
3Claude Sonnet 4.696.6
4GPT-5.596.6
5Claude Opus 4.894.4
6GPT-5.4 Mini92.1
7GPT-5.6 Sol82.9
8DeepSeek V4 Pro68.3
9Claude Fable 568.3
10Claude Opus 568.3
11Gemini 3.1 Pro (Preview)67.5
12Kimi K365.1
13DeepSeek V4 Flash62.7
14Gemini 3.5 Flash49.4

Interactive version: theaggregate.ai/benchmark?slug=spacetimedb-llm-benchmark-rust · How It Works · Data refreshed daily, snapshot 2026-09-05.