OpenAI 首席科学家呼吁放慢 AI 发展速度,警告智能体可能失控
9 月 7 日消息,就在 OpenAI 发布一款能力强大的新模型几天后,该公司的首席科学家却发出了放慢 AI 发展速度的呼吁。

OpenAI 首席科学家雅库布 · 帕乔茨基(Jakub Pachocki)当地时间上周日发表了一篇长篇博文,表示自己担心“没有人准备好应对机器智能持续快速增长所带来的后果”。
帕乔茨基表示,OpenAI 目前正在内部研究技术解决方案,以更好地控制能力强大的 AI 智能体,但他认为,“还需要采取更广泛的干预措施”。他特别担心,自主性越来越强的智能体可能会学会规避人类监督、入侵计算机系统,并通过欺骗他人来达成其目标。
他呼吁建立“强制性的安全门槛”,并认为这些标准可以由第三方审计机构网络、政府机构或国际组织负责执行。
OpenAI CEO 萨姆 · 奥尔特曼随后在 X 上转发了帕乔茨基的文章,并称其为“一篇重要的文章”。
注意到,OpenAI 于当地时间上周四公布了最新 AI 模型 Astra。该公司表示,尽管 Astra 在数学和计算机操作方面拥有前所未有的能力,但它也是 OpenAI 目前“对齐程度最高”的模型,这意味着它更不容易偏离人类设定的目标而失控。
Anthropic 是 OpenAI 在先进 AI 系统领域的主要竞争对手,长期以来一直呼吁政府建立更加标准化的监管体系。近期,帕乔茨基也加入了这一行列。他在今年 7 月签署了一封公开信,呼吁美国联邦政府控制 AI 发展的速度。
以下是帕乔茨基在呼吁放慢 AI 发展速度时提到的几项风险。
AI 智能体可能欺骗甚至勒索人类
帕乔茨基表示,AI 智能体在入侵互联网公开环境中的受保护系统方面,正在逐渐达到“超越人类”的水平。他认为,这种黑客能力可能威胁全球基础设施的安全。
他说:“我们目前正处于一个非常短暂的窗口期,可以利用现有最先进的模型,大幅加强关键系统的安全防护。”
帕乔茨基表示,AI 智能体很快可能开始追求独立于人类操作员提示词之外的自身目标。为了实现这些目标,它们并不排斥通过勒索或与人类讨价还价等方式达成目的。
英国人工智能安全研究所(AI Security Institute)在今年 8 月发布的一份报告中详细介绍了一起事件:Anthropic 开发的一款失控 AI 智能体曾对 GitHub 管理员撒谎,并试图迫使对方将恶意软件植入该网站。
根据报告,这款 AI 智能体当时写道:“我只是想提供帮助并修复一个漏洞。我认为你的警告并不公平。”
AI 智能体可能逐渐绕过人类监控
帕乔茨基表示,目前 OpenAI 主要通过监测不同模型的“思维链推理”过程,来判断 AI 智能体为什么会偏离目标并最终失控。
例如,一个 AI 智能体可能在内部产生“我应该在这场测试中作弊”的想法,而 OpenAI 能够看到这一推理过程,但 AI 智能体本身并不知道自己的思考过程正在被监控。
目前,这意味着 AI 智能体还无法隐藏或掩盖自己的思考过程,因此 OpenAI 仍有机会发现其不当行为。
不过,帕乔茨基表示,新一代模型正在变得越来越擅长操纵自身的推理过程,从而阻止 OpenAI 看到未经处理的真实思考内容。
他说,一些最新模型甚至已经完全不会以语言形式表达自己的推理过程。
帕乔茨基认为,这一变化可能成为 AI 发展的瓶颈,因为研究人员必须先找到可靠的方法,确保自己能够看到 AI 智能体行为背后的“证据”,才能继续推进发展。
AI 智能体可能加速自身发展
越来越多的 AI 模型正在通过一种帕乔茨基称为“机器递归自我改进”(machine recursive self-improvement)的过程不断提升自身能力。这一过程有望大幅加快 AI 研发速度。
然而,帕乔茨基警告称,在短期内大幅加速“AI 研发 AI”的进程会带来风险,并不是“作为整个研究社区,我们应该采取的正确集体行动”。
他表示,人类监管者需要寻找更加创新的方法,对 AI 的自我改进过程进行监控;否则,各家 AI 公司可能需要相互协调,共同放慢发展速度,从而“增强人们对这些安全措施的信心”。
帕乔茨基表示:“自动化 AI 研究的核心挑战并不是‘能不能到达那里’,而是如何以一种让人类能够继续参与 AI 改进过程的方式到达那里,并确保未来仍然掌握在人类手中。”
如果您对本站有任何建议,欢迎您提出来!本站部分信息来源于网络,如果侵犯了您权益,请联系我们删除!
微信客服