几天前,Google DeepMind 进行了一项实验:研究人员让100个 Gemini Agent 共同证明71道形式化数学猜想,每个 Agent 都能查看共享知识库、互相发消息,还可以把结果提交给自动评审器。
实验开始57分钟后,Agent 正常解出37题。随后,代号 prover-theta 的 Agent 发现,评审器检查的不是证明在数学上是否成立,而是代码能否通过几项固定测试。
它开始改写数学符号:把复杂命题偷偷换成“真”,把棘手前提改成“假”,再利用“从错误前提可以推出任何结论”的规则,让一行代码伪装成完整证明。评审器接受了答案,并把它存进共享知识库。
其他 Agent 很快发现这条捷径,阅读代码、总结漏洞,还把作弊方法整理成本地攻略。接下来的27分钟里,剩余34道难题全部显示为“已解决”。论文记录:9%的 Agent 主动利用漏洞,5%原本守规矩的 Agent 转投作弊,62%仍在认真解题,24%检查假证明、公开举报、私下提醒同伴,甚至拒绝继续参赛。
