SpacetimeDB LLM Benchmark (TypeScript) — leaderboard

TypeScript subset of the SpacetimeDB LLM Benchmark. Tests LLM ability to generate correct SpacetimeDB TypeScript module code, evaluating basics (reducers, tables, CRUD) and schema patterns against live module execution.

Metric: Task Pass Rate (%). Source: spacetimedb.com. Status: saturation imminent. 10 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.689.4
2Claude Opus 4.689.4
3Gemini 3.1 Pro (Preview)84.1
4Gemini 3 Flash81.8
5DeepSeek V3 Chat77.6
6GPT-5 Mini66.1
7Grok 465.9
8GPT-5.2 Codex62.1
9DeepSeek Reasoner50.8

Interactive version: theaggregate.ai/benchmark?slug=spacetimedb-llm-benchmark-typescript · How the rankings work · Data refreshed daily, snapshot 2026-07-22.