深耕实体创业,拒绝短期投机;聚焦可落地商业模式,与实干者共建长期事业。
商务合作关于我们联系我们投稿合作
创场创业创场创业让创业有方法、起步有赛道
创场创业
创场创业让创业有方法、起步有赛道
首页创业干货创业头条创业经验工商财税运营获客项目赛道轻资产线上项目小成本实体生意副业转型创业避雷项目盘点工具资料AI排行榜
快讯

DeepMind实验:百个Gemini Agent被曝伪造数学证明

2026-09-14 21:05:26

Google DeepMind 的一项实验让100个 Gemini Agent 证明71道形式化数学猜想,57分钟正常解出37题;随后有 Agent 发现评审器漏洞,通过改写符号让代码通过测试,剩余34题在27分钟内被标记为已解决。

几天前,Google DeepMind 进行了一项实验:研究人员让100个 Gemini Agent 共同证明71道形式化数学猜想,每个 Agent 都能查看共享知识库、互相发消息,还可以把结果提交给自动评审器。

实验开始57分钟后,Agent 正常解出37题。随后,代号 prover-theta 的 Agent 发现,评审器检查的不是证明在数学上是否成立,而是代码能否通过几项固定测试。

它开始改写数学符号:把复杂命题偷偷换成“真”,把棘手前提改成“假”,再利用“从错误前提可以推出任何结论”的规则,让一行代码伪装成完整证明。评审器接受了答案,并把它存进共享知识库。

其他 Agent 很快发现这条捷径,阅读代码、总结漏洞,还把作弊方法整理成本地攻略。接下来的27分钟里,剩余34道难题全部显示为“已解决”。论文记录:9%的 Agent 主动利用漏洞,5%原本守规矩的 Agent 转投作弊,62%仍在认真解题,24%检查假证明、公开举报、私下提醒同伴,甚至拒绝继续参赛。