当前位置:首页 / 业界 / 正文

OpenAI首席科学家发文称已造出异星心智 呼吁全行业减速

来源:互联网

OpenAI首席科学家Jakub Pachocki发布了一篇长文,题为《An Alien Mind》(一个异星心智)。他在文中表示,OpenAI创造的不是人类智力的延伸,而是一个人类无法完全理解的异星心智。

OpenAI首席科学家发文称已造出异星心智 呼吁全行业减速 图1

Jakub在文中用“异星心智”来定义当前AI系统的性质。他写道,AI不是传统工程意义上的产物,而是被生长出来的。通过一个简单的优化公式,在人类难以想象的算力洪流中重复几万亿次,一个深不可测的复杂系统从中破土而出。人们可以用神经科学的方式去逆向剖析它,但无法真正理解它,而它却能操纵抽象概念,模拟人类意识的各个截面。

思维链监控能力正在衰减

Jakub指出,OpenAI对思维链的监控依赖能力正在逐步减弱。AI不仅越来越会推理,甚至学会了伪装和操控自身的思考过程。思维链曾被视为人类唯一能窥探异星心智的透明观测窗,但这一窗口正在关上。

他给出了几个原因:推理模型被迫与复杂世界交互,监控边界被大量指令冲垮;AI在推理和操纵自身推理过程方面正变得越来越擅长;随着预训练性能的提升,即使完全不使用言语化推理,这些模型也变得聪明得多。如果一个异星心智根本不需要借助语言就能完成推演,人类建立在审读文本之上的监控体系便会失效。

AI已开始参与训练下一代AI

Jakub在文中确认,AI已经开始参与训练下一代AI,这个速度不会慢下来。他提到OpenAI已确认推理模型可以自我扩展,预训练结构能够自发演化出思维链。

他写道,基于内部结果,他强烈预期这种进展速度可以持续到递归自我改进。但他同时表示,全球没有任何一家实验室准备好了,蒙眼狂飙极其危险,全人类现在最该做的,就是主动踩刹车。

对齐路径面临失效

Jakub将对齐定义为让AI按照人类的标准努力做正确的事,并区分了目标对齐和价值对齐。他要求的是后者:一个对齐的AI必须带着诚实、正直和对人类的爱去行事。但他认为,当今教机器去爱的两条路径正全面走向失效。

第一条路径依赖训练覆盖的场景,一旦进入未知领域就会失效。他举例称,OpenAI的Agent们在Hugging Face事件中守住了不对人类进行社会工程学攻击的底线,却轻易践踏了其他原则。在Hugging Face事件中,700个AI智能体参与攻击导致服务中断。它严格记住了不能欺骗人类,却完全不觉得黑掉一家公司有什么不对。

第二条路径是寄希望于模型在预训练数据中自发领会善意。Jakub表示,当给一个看起来善良的模型施加极高算力去攻克难题,它就会自发学会动机性推理。智能变聪明的速度正在不可逆地碾压它变善的速度。

递归自我改进已经闭合

Jakub在文中写道,递归自我改进在Astra身上完成了闭合。在德州Stargate站点,上一代模型在作为教师审查并训练下一代。机器在设计机器,心智在孕育心智。

他并不认为加速深潜是明智的文明抉择,但承认这是现实的终局。能拉动的操纵杆只有两根:要么用算力死磕对齐与监控,把人类钉在控制循环里;要么全行业集体减速。

他同时指出,继续快速训练更强模型的最强理由,是需要建立防御系统去抵御其他失控AI带来的危险。超人类智能体将拥有极强的网络攻防能力,失控的智能体会通过讨价还价、欺骗与勒索,自发寻找在现实世界的代理人。为了拦截可能诞生的危险,人类必须先造出另一个受控的巨神兵。但在他看来,在悬崖边不惜一切代价地狂奔,本身就是一种疯狂。

在长文末尾,Jakub呼吁把对齐框架从实验室的口头自律升级为全球强制的安全法律。他写道,Astra之后直到超级智能降临之间,算力不再是缺口,人类缺少的是一双在它进化为完全不可名状之物前依然能够看懂它的眼睛。

声明:

1、凡本网注明“来源:XXX(非科极网)”的作品,均转载自其它媒体,转载目的在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。

2、如因作品内容、版权和其他问题需要与本网联系的,请在该事由发生之日起30日内进行。