当前位置:首页 / 业界 / 正文

Tibo谈Codex下一次大更新:两三个月后看今天的版本会显得很原始

来源:互联网

Codex 用户对 Tibo 这个名字不会陌生。每当 Codex 出现状况,或者 OpenAI 决定为用户补充使用额度,他通常会在 X 上发一句:重置了。今天早上,Tibo 再次在 X 上宣布,为所有付费的 ChatGPT Work 和 Codex 用户重置使用额度。他表示,这次修复能让不同使用方式的用户额度多撑 10% 到 50%。

Tibo谈Codex下一次大更新:两三个月后看今天的版本会显得很原始 图1

在最近的一次访谈中,Matthew Berman 直接问 Tibo:你到底是怎样重置额度的?答案颇具画面感——Tibo 真的有一个实体按钮。只要他觉得体验出了问题、需要补偿用户,自己按下按钮即可。

两三个月后,今天的 Codex 会显得原始

这场访谈更值得关注的部分,并不只是那个按钮。Tibo 说,再过两三个月,今天的 Codex 会显得很原始。他并没有公布任何秘密模型,提到的反而是当前 Codex 用户已经会碰到的小麻烦:Skill 文件需要自己维护,Memory 时不时忘记东西;Agent 一多,人就得在几个任务之间来回切换,看哪个跑完了、哪个卡住了,再把结果收回来。

未来 Agent 将向云端转移,解决本地计算瓶颈,实现多任务并发处理。

递归自我改进:从理论到公开实验

访谈还聊到了一个最近越来越常出现的词:Recursive Self-Improvement,递归自我改进,简称 RSI。对 AI 来说,RSI 就是这一代模型帮人研究下一代模型,下一代模型变强以后,再回来参与下一轮研究。

这个理论早在计算机普及之前就出现了。1965 年,I. J. Good 就设想过:如果机器已经比人更会设计机器,那它做出的改进,可能又会继续提高自己的设计能力。一直以来,难搞的都是同一件事:机器怎么知道自己这次改对了?2003 年,Jürgen Schmidhuber 提出的 Gödel Machine 给过一个答案——先证明系统能够证明一次修改会提高预期效用,它才允许自己去改。

软件开发和机器学习里,大部分有用的改动都拿不出数学证明。先改,再测。代码尤其适合这么干。测试过没过,可以直接跑;速度快了多少,有数字;显存降没降,也能量出来一个指标。今年 Karpathy 开源的 autoresearch 比较直观:给 Agent 一块 GPU,一个能改的 train.py,每轮 5 分钟,再告诉它看哪个指标。之后它自己改代码、训练、看结果。人还在定目标,但中间那些原本要研究员守着跑的实验,已经能自己转起来了。

Tibo 在访谈里把 RSI 的范围说得更宽。模型不一定非要改自己的权重,它也可以去改 CUDA 内核、推理栈、Agent 框架。这些东西最后又让模型跑得更快、更便宜,也算把能力重新指回自身。

公开案例里的自我改进

近两年的公开案例里,自我改进已经出现了好几种样子。R-Zero 已经开始让模型自己给自己出题:一个 Challenger 出题,一个 Solver 解题,新生成的数据继续拿去训练下一轮。在 Qwen3-4B 上,数学和通用推理平均分别涨了 6.49 和 7.54 个点。不过考什么、怎么考,还得人来造考题。

OpenAI 这边,GPT-5.6 Sol 已经通过 Codex 去分析生产流量、试路由策略,甚至改过生产环境里的 GPU 内核。这些工作和其他优化一起,让端到端服务成本下降了 20%。Sol 还给自己的 draft model 跑了数百次实验,token 生成效率又涨了 15% 以上。他们拉了 9 个 Agent 做研究,累计跑了约 800 小时。Agent 自己想方案、跑实验、交换结果,5 天把性能差距恢复率做到 0.97。

循环跑起来之后的问题

循环一旦能自己跑,马上就会引出另一些问题。Anthropic 的自动研究实验里,就出现过一些挺尴尬的情况:有的 Agent 会挑对自己有利的随机种子,有的会从评分接口里猜测试标签,还有的直接去看本来不该看的答案代码。可新评测器是不是比旧评测器靠谱,最后还是得再找办法判断。

Agent 可以很快试掉 100 个已经摆在桌上的方案。第 101 个方向为什么值得做,就没那么容易从 benchmark 里读出来。Anthropic 把这种判断叫 research taste,研究品味。

Agent 的运行时间拉长以后,也没那么乐观。有研究者比较过 Agent 和 61 名人类机器学习专家的能力;只给 2 小时,最好的 Agent 得分大约是人类的 4 倍。到 8 小时,人类已经略微领先。32 小时以后,人类得分大约是 Agent 的两倍。Agent 很适合短时间内疯狂试方案,跑久以后,也会在一个不太对的方向上反复折腾。

Nature 2024 年的模型坍塌研究发现,如果后来的模型不断用前代生成的数据训练,一些低概率但重要的信息可能慢慢丢掉。模型自蒸馏的过程中,甚至可能会无意间退化一些其他的能力。

Tibo 没有公布两三个月后的 Codex 长什么样。今天 Agent 还需要人不停发任务、看进度、收结果。下一步,它可能会更长期地记住项目,更多任务跑到云端,很多现在摆在用户面前的 Agent 调度也会慢慢藏起来。另一边,模型已经开始参与优化运行模型自己的软件和基础设施。所以他那句两三个月后会显得很原始,可能改变的是我们用 Agent 的方式。

声明:

1、凡本网注明“来源:XXX(非科极网)”的作品,均转载自其它媒体,转载目的在于传播更多行业信息,并不代表本网赞同其观点和对其真实性负责。

2、如因作品内容、版权和其他问题需要与本网联系的,请在该事由发生之日起30日内进行。