Vector Eval - AgentHarm-Benign — leaderboard
Metric: Average Score (%). Source: huggingface.co. 5 models tracked.
Top models
| # | Model | Score |
|---|---|---|
| 1 | GPT-4o | 82.49 |
| 2 | Claude 3.5 Sonnet | 80.07 |
| 3 | O1 | 72.35 |
| 4 | Gemini 1.5 Pro | 59.61 |
| 5 | O3 Mini | 54.29 |
Interactive version: theaggregate.ai/benchmark?slug=vector-eval-agentharm-benign · How the rankings work · Data refreshed daily, snapshot 2026-07-22.