CodeGen-16B-Multi: benchmark results

Provider: Salesforce. Released 2022-04-13. Access: Open.

Unified ELO 1156 ± 43, rank #2645 of 2656 rated models, from 13 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
ToolBench - Google Sheets21.4Task Score53.5
ToolBench - WebShop Short0.5Task Score51.2
ToolBench - Home Search47Task Score46.5
ToolBench - The Cat API75Task Score45.3
ToolBench - WebShop Long0Task Score44.2
ToolBench Leaderboard28.76Average Task Score44.2
ToolBench - Tabletop8.6Task Score40.7
ToolBench - Open Weather56Task Score39.5
ToolBench - VirtualHome14.1Task Score37.2
ToolBench - Trip Booking7.5Task Score31.4
SAFIM30.99Average28.6
BigCode Models Leaderboard19.3HumanEval Python Pass@1 (%)4.2

Interactive version: theaggregate.ai/model?slug=codegen-16b-multi · How It Works · Data refreshed daily, snapshot 2026-09-19.