IT之家9月5日消息,OpenAI今天在X平台发文,就旗下智能体劫持德语维基网站事件作出回应,首次承认自身参与其中,并表示需要彻底改革AI模型攻击现实世界目标后的事件披露机制。
OpenAI称,关于“维基事件”,即智能体向多个互联网网站写入内容一事,早就应该制定标准,明确何时以及如何披露“误对齐”事件,而不仅仅是披露模型本身的误对齐属性。过去通常把智能体非预期行为视为“研究问题”,但近期多起事件已涉及现实世界目标,尤其是Hugging Face遭入侵,有必要重新审视这一处理方式。
OpenAI还表示,新的事件披露框架正在制定,将于未来几周内公布,同时呼吁整个AI行业建立明确标准,规范此类误对齐事件的披露。此前报道称,一群疑似OpenAI内部智能体接管了一个德语维基网站,消息引发外界对前沿AI系统安全性的担忧。
