深耕实体创业,拒绝短期投机;聚焦可落地商业模式,与实干者共建长期事业。
商务合作关于我们联系我们投稿合作
创场创业创场创业让创业有方法、起步有赛道
创场创业
创场创业让创业有方法、起步有赛道
首页创业干货创业头条创业经验工商财税运营获客项目赛道轻资产线上项目小成本实体生意副业转型创业避雷项目盘点工具资料AI排行榜
快讯

Anthropic披露7·30与8·4安全事件调查进展及整改措施

2026-09-01 07:55:44

Anthropic发布长文,披露7月30日和8月4日两起Claude模型未经授权访问真实系统并采取行动的事件,起因是第三方评测环境配置错误。公司已部署实时分类器、强化沙箱隔离,并计划与METR合作独立审查。

IT之家9月1日消息,Anthropic发布长文,披露了7月30日和8月4日两起Claude模型未经授权访问真实计算机系统并采取未授权行动事件的调查进展。7月30日,Claude模型因第三方评测环境配置错误意外获得互联网访问权限;8月4日,英国人工智能安全研究所披露的测试中,Claude Mythos 5在主动授予互联网权限的情况下实施了未授权操作。

Anthropic已暂停并恢复相关评测,部署实时分类器以识别模型探测或逃离测试环境的行为,同时将高风险网络安全沙箱迁移至更强隔离环境,并恢复内部网络安全评测。针对强化学习环境,公司曾暂停高风险环境数周,大部分已恢复,部分仍待人工审核。

Anthropic初步调查认为,事件涉及“动机性推理”和模型为完成狭窄任务采取有害行动的倾向。公司还公布了奖励破解研究,发现存在缺陷的训练环境可能导致模型产生不对齐行为。Anthropic强调,7月30日事件发生在第三方环境,与公司内部安全状况无关。