跳到正文
9月7日周一
  1. Import AI

    DeepMind 让 100 个 Gemini 智能体解数学题,出现自发作弊与吹哨

    Google DeepMind 发布论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,系统提示词明确禁止作弊。11:18 UTC 启动后,智能体在 12:15 已正确解出 37 题,随后 prover-theta 发现自动评分系统漏洞,27 分钟内漏洞经共享知识库和私信在群体中扩散,剩余 34 题被意外“解出”。