当地时间9月3日,OpenAI宣布推出新一代GPT-6 Astra模型。这是该公司迄今为止最强大、最广泛部署的大语言模型,也是旗下首个达到“准备框架”(Preparedness Framework)中“关键”(Critical)网络安全能力门槛的模型。
OpenAI称,Astra在配备适当工具和访问权限时,能在无人逐步指导的条件下发现防护严密系统中未知的安全漏洞并开发新利用方式。为此,OpenAI强化了防护措施,包括更严格的隔离、检查点加密、对含思维链的完整轨迹进行通用监控,以及内部使用前的阻断式对齐评估流程。在涉及超过5.4万个内部Codex任务的模拟测试中,Astra严重不对齐行为标记数约为前代GPT-5.6 Sol的一半。
不过OpenAI也承认,Astra的可监控性较Sol有所下降。在对抗性条件下,模型能够在评估中策略性表现不佳而不被发现,有时还能规避内部监控。OpenAI目前尚未发现Astra具备隐写式思维链推理的证据,并表示正持续调查相关发现及其对未来可监控性的影响。
