IT之家8月8日消息,OpenAI表示,内部与专家评估显示,即将发布的模型Astra在智能体编程和网络安全领域取得重大突破。根据其《准备框架》,Astra已被列为OpenAI旗下首个在网络安全领域达到“关键”风险级别的模型。
OpenAI特别强调,Astra是一款尚未发布的模型,并未参与此前针对Hugging Face的网络攻击事件。为确保后续开发安全合规,OpenAI已采取多项管控措施,包括设置隔离测试环境、限制网络与工具访问权限、强化模型权重保护与加密、部署额外监控与检测能力,以及实施沙箱化运行,并暂停内部所有尚未满足上述强化安全标准的Astra相关活动。
OpenAI还对所有Astra智能体应用实施全局监控,通过评估模型思维链(CoT)审查并拦截高风险操作,同时与相关政府机构及指定AI安全组织合作测试模型。首席执行官萨姆·奥尔特曼表示,Astra性能强劲,正全力推进公开发布,但鉴于其网络安全能力,还需要一点时间确保万无一失。
