Anthropic于当地时间8月14日发布安全报告,称其用于拦截化学、生物武器相关危险请求的部分安全分类器出现长期失效,导致2025年5月至2026年4月期间外部承包商提供人工反馈时产生的大量请求未经过滤。
报告显示,约5万名承包商在相关时间段内产生了约1.33亿次与模型的对话,这些流量近一年未经过生物安全分类器拦截。Anthropic称这些承包商主要由外部供应商审核,筛查流程存在不足,内部调查未发现请求被实际滥用的证据。
Anthropic已根据调查结果加强外部承包商的筛查和管理要求。该公司此前在Claude Opus 4发布时启用了ASL-3防护措施,实时提示词和输出分类器用于监测模型输入输出,识别危险请求时阻止模型提供相关信息,红队测试、漏洞赏金计划等作为补充。
