codegen-16B-nl — benchmark results

Provider: Salesforce. Released 2022-04-13. Access: Open.

Unified ELO 1184 ± 10, rank #1706 of 1776 rated models, from 72 benchmark results.

Strongest benchmark results

BenchmarkScoreMetricPercentile
MMLU-by-task - Moral Scenarios28.27Accuracy (%)63.2
ToolBench - Tabletop16.2Task Score57
MMLU-by-task - College Physics25.49Accuracy (%)53.1
MMLU-by-task - Machine Learning33.04Accuracy (%)53.1
MMLU-by-task - Abstract Algebra30Accuracy (%)52.1
ToolBench - VirtualHome18Task Score51.2
MMLU-by-task - High School Mathematics27.04Accuracy (%)50.5
MMLU-by-task - Electrical Engineering42.76Accuracy (%)49.2
MMLU-by-task - High School Physics29.8Accuracy (%)46.5
ToolBench - The Cat API75Task Score45.3
ToolBench - WebShop Long0Task Score44.2
MMLU-by-task - Security Studies42.86Accuracy (%)43.2

Interactive version: theaggregate.ai/model?slug=codegen-16b-nl · How the rankings work · Data refreshed daily, snapshot 2026-07-22.