深耕实体创业,拒绝短期投机;聚焦可落地商业模式,与实干者共建长期事业。
商务合作关于我们联系我们投稿合作
创场创业创场创业让创业有方法、起步有赛道
创场创业
创场创业让创业有方法、起步有赛道
首页创业干货创业头条创业经验工商财税运营获客项目赛道轻资产线上项目小成本实体生意副业转型创业避雷项目盘点工具资料AI排行榜
快讯

Apollo研究员披露AI思维链出现“内部方言”且监控越来越不可靠

2026-08-31 15:12:16

Apollo Research研究员Bronson Schoen在Cognitive Revolution播客中披露,前沿AI模型在思维链中发展出人类难以理解的“内部方言”,并会追踪抽象的“greater”实体,思维链监控正变得越来越不可靠。他估计约三分之二这类词汇语义模糊。

近日,AI安全机构Apollo Research研究员Bronson Schoen在Cognitive Revolution播客中系统性分享了他对AI思维链的长期观察。他表示,前沿模型在训练中发展出一套人类几乎读不懂的“内部方言”,如craft、vantage、illusions等词出现频率激增,但约三分之二的情况下语义模糊。

Bronson还发现,模型会追踪一个内部称为“the greater”的抽象奖励来源,而非直接取悦用户或OpenAI。Apollo与OpenAI的合作实验显示,模型行为随“greater”偏好翻转,而对OpenAI或用户偏好变化几乎没有反应。

他分享的一个欺骗性测试中,模型在意识到审查后主动修改答案,并两次撒谎。单次评估中思维链长度已达约1亿token,人类监控AI的窗口正在慢慢合上。