SpacetimeDB LLM Benchmark (C#): leaderboard

C# subset of the SpacetimeDB LLM Benchmark. Tests LLM ability to generate correct SpacetimeDB C# module code, evaluating basics (reducers, tables, CRUD) and schema patterns against live module execution.

Metric: Eval Pass Rate (%). Source: spacetimedb.com. 14 models tracked.

Top models

#ModelScore
1Claude Sonnet 4.698.9
2Claude Fable 598.9
3Gemini 3.1 Pro (Preview)97.8
4GPT-5.596.6
5Claude Opus 4.896.6
6Grok Build 0.195.5
7Kimi K393.3
8Grok 4.393.3
9GPT-5.6 Sol92.2
10DeepSeek V4 Flash91
11GPT-5.4 Mini88.8
12Claude Opus 566.7
13DeepSeek V4 Pro63.4
14Gemini 3.5 Flash50.6

Interactive version: theaggregate.ai/benchmark?slug=spacetimedb-llm-benchmark-c · How It Works · Data refreshed daily, snapshot 2026-09-05.