SpacetimeDB LLM Benchmark (TypeScript): leaderboard

TypeScript subset of the SpacetimeDB LLM Benchmark. Tests LLM ability to generate correct SpacetimeDB TypeScript module code, evaluating basics (reducers, tables, CRUD) and schema patterns against live module execution.

Metric: Eval Pass Rate (%). Source: spacetimedb.com. Status: saturation imminent. 14 models tracked.

Top models

#ModelScore
1GPT-5.6 Sol99.5
2Claude Sonnet 4.697.8
3GPT-5.597.8
4Claude Opus 4.897.8
5Grok 4.397.8
6Grok Build 0.197.8
7Gemini 3.1 Pro (Preview)97.4
8GPT-5.4 Mini96.6
9Claude Opus 596.4
10Claude Fable 595.3
11Kimi K393.3
12DeepSeek V4 Flash93.2
13DeepSeek V4 Pro89.1
14Gemini 3.5 Flash44.9

Interactive version: theaggregate.ai/benchmark?slug=spacetimedb-llm-benchmark-typescript · How It Works · Data refreshed daily, snapshot 2026-09-05.