OpenAI GPT-6 Astra Launch - Internal Computer Use Safety Benchmark: leaderboard
Metric: Unintended-consequence rate (%). Source: openai.com. 5 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-6 | 2.4 |
| 2 | Claude Fable 5.1 | 9.5 |
| 3 | Claude Opus 5 | 11.5 |
| 4 | Claude Fable 5 | 18.3 |
| 5 | GPT-5.6 Sol | 22 |
Interactive version: theaggregate.ai/benchmark?slug=openai-gpt-6-astra-launch-internal-computer-use-safety-benchmark · How It Works · Data refreshed daily, snapshot 2026-09-19.