DeepSeek Harness来了:AI开始制造AI了?
来源:36kr 3 小时前

"第一台超智能机器,将是人类最后一项发明。"

这句话出自数学家I.J. 古德在1965年发表的论文《关于第一台超智能机器的猜想》。言外之意,机器一旦比人聪明,就能自己设计更聪明的下一代。

这个循环的第一步是让机器开始动手改进自己。这也是AI圈内最近备受关注的RSI(Recursive Self-Improvement,递归式自我改进)的含义。

简单来说,RSI就是让AI自己参与造更强的AI,再让更强的AI加速下一轮AI的改进,循环往复。

在Codex、Claude Code、Kimi、Hy都有了自己的Harness之后,上周DeepSeek终于推出了DeepSeek Harness(DSH)。

尽管DSH姗姗来迟,而且还只是一个开发者预览版,但依然引起了巨大关注。这是因为,梁文锋对RSI路径的规划,开始清晰地显现出来了。

在7月底内部的四小时发言中,梁文锋将AI的发展比喻成一个个阶梯:LLM—CoT—Agent—持续学习—自我迭代—具身智能。在他看来,AI的自我迭代,将会带领大家走到一个奇点。

当然,DSH还是DeepSeek在探索RSI路上的一次落点,还远远到不了奇点。发布几天后,也被一些用户吐槽部署繁琐、配置复杂,体验上感觉像是“半成品”。但这作为一次对AI业内对RSI探索的呼应,还是让AI圈内兴奋。

那么,DeepSeek给实现RSI提供了怎样的解法?当各家都在追求RSI时,业内竞争的方向又发生了怎样的转变?

一、DeepSeek怎么让AI自进化?

在内部发言中,梁文锋讲了一句挺奇怪的话。他说,DeepSeek做的模型,“第一目标不是大家用得好用,而是我们自己用得好用”。

模型做出来,不就是给用户用的吗?梁文锋进一步解释,模型先服务于DeepSeek,这是DeepSeek实现AGI最快的办法。

RSI不等于AGI,也不是说有了RSI就一定能实现AGI。但RSI解决了追求AGI路上的一个关键问题:谁来加速AI能力本身的进化?

所以,AGI是目标,RSI是手段。让AI帮助自己不断变强,最终把AI的能力推向AGI。

具体来讲,RSI是怎么帮助DeepSeek走向AGI的?

在发布DSH的同时,DeepSeek和北京大学联合发表了论文《a programming paradigm for spatiotemporal composability》,透露了更多关于这套架构的思路。

DSH的底层运行框架里,有一个叫Cordis的核心机制。它试图解决的是行业的一个老难题:传统插件系统普遍擅长将插件装上去,却很难在不重启整个进程的情况下,把一个插件留下的影响完整撤掉。

这个问题放在一个要求能自进化的AI Agent身上,就是致命的。

一个Agent的运行环境里通常塞满了工具、权限、沙箱、记忆、会话状态等等组件。想象一下,如果未来Agent为了提升自己的能力,需要持续修改这些插件,那么每次修改都要求整个系统重启,原本持续运行的状态就会被打断。更麻烦的是,一次失败的修改还可能把系统带进一个无法恢复的中间状态。

那么,创造一个让AI敢于自我进化的环境就至关重要。Cordis尝试从时间和空间两个维度去解决,一是让插件退出时,它此前产生的影响能够被追踪和撤销;二是插件之间的依赖发生变化时,系统能够自动重新协调。这就是论文题目里提到的temporal composability(时间可组合性)和spatial composability(空间可组合性)。

这不是纸上谈兵。这套机制已经在一个叫做Koishi的开源聊天机器人框架里跑了4年,后者拥有四千多个社区插件。当然,这套机制未来还需要在更大规模的插件系统里验证。

现在回头看梁文锋那句话,就不怪了。他说模型先得自己用得好用,落到工程上,就是得先给模型一块允许它不断修改自己的底座:新的组件装得上,旧的卸得干净,改坏了能恢复,组件之间的关系还能自动重新组织。

当这种自我修改变成一种可以持续、可以失败、也可以回退的工程过程,AI自我进化才算真正有了能落脚的土壤。

二、大厂AI in RSI

作为AI届最诱人的里程碑之一,RSI吸引的人可不止梁文锋。

7月份,谷歌DeepMind的掌门人哈萨比斯在接受专访时表示,大多数前沿实验室都在致力于研究RSI。一个月后,谷歌DeepMind的首席战略官Jasjeet Sekhon也公开表示,RSI正成为AI资本开支的核心投资逻辑。

"当年人类正是依靠蒸汽机来制造新一代蒸汽机。"Jasjeet Sekhon认为,用AI来造AI,听起来并没有那么不可思议。

图:哈萨比斯接受专访

DeepMind已经有一个接近RSI的实际案例,叫做AlphaEvolve,目前已经运行一年多。

AlphaEvolve的核心机制并不复杂。它先让Gemini生成一批程序,再交给自动评估器运行、验证和打分。表现好的方案会被保留下来,继续成为下一轮生成和组合的基础。这个过程可以持续循环,不需要工程师插手。

这套方法最关键的地方,在于评价环节也被自动化了。只要一个问题能够建立相对客观的评价标准,AI就可以自己进行大量试错:生成一个方案,运行它,看看分数,再根据结果继续寻找更好的方案。

Google已经开始用AlphaEvolve优化自己的计算基础设施。Google称,AlphaEvolve为数据中心调度找到了一种新的算法,平均回收全球约0.7%的计算资源;在Gemini的训练过程中,它又将一个关键的矩阵乘法内核加速了23%,使Gemini的整体训练时间缩短约1%。

今年8月,谷歌AI团队经历了一次引人瞩目的动荡。尽管劳燕分飞,大家的目标依然一致:接下来要追求RSI。

在Google干了27年的Jeff Dean离职,带走几个研究员创办了Discovery Loop,核心方向就是RSI。谷歌的联合创始人Sergey Brin同样还在内部大力推动资源流向RSI。

两家明星AI公司OpenAI和Anthropic也是押注了RSI。7月,OpenAI在GPT-5.6的发布说明里有一个新指标叫做RSI-Index,就是专门衡量模型的自进化程度。

Anthropic今年成立的Anthropic Institute,也将RSI列为重点研究方向之一。在一个叫Automated Weak-to-Strong Researcher的实验中,Anthropic已让Claude驱动的多个AI agent自主提出研究假设、设计并运行实验、分析结果,再根据结果迭代下一轮方案,在一个AI对齐问题上取得了优于人工研究者的结果。

Anthropic联合创始人Jack Clark更是给出预测,称RSI有60%的概率在2028年底之前发生。

在国内,有玩家比DeepSeek更早在做接近RSI的探索。比如,腾讯在7月推出了Hyra-1.0,官方称这是一个能够递归自我改进、专为性能导向的研究与工程任务打造的智能体。除了公开基准,它还能在十余个不同的真实场景中产生价值。

图:腾讯混元发布Hyra-1.0

MiniMax还要早,在3月发布M2.7时,官方标题就是"Early Echoes of Self-Evolution(自我进化的早期回响)"。它让早期模型自己搭了一套harness,分析失败轨迹、规划改动、修改脚手架代码、跑评测、决定保留还是回退。这套循环跑了一百多轮后,把内部评测的成绩抬高了3成。

三、环境、反馈和循环成了兵家必争

当RSI成为通往AGI的一种重要设想,它开始改变AI公司的竞争方向。

过去,行业习惯把模型发布当作能力变化的时间节点。一家公司的新模型上线,跑一轮榜单,行业重新排队。现在,新模型发布依然重要,但模型之间的领先周期正在缩短,单次发布越来越难以代表一家公司的长期能力。与此同时,实现RSI的路径,也发生在模型发布之后。

RSI的基本设想是让AI进入一个能持续改进的循环中。这对AI基础设施提出了新的要求。

首先,模型不能只接触已经整理好的训练数据,还需要进入真实任务,拥有可以行动、修改和验证的环境,在实际工作中不断暴露问题。

其次,系统还需要可靠的反馈机制,能够判断一次修改究竟解决了问题,还是只让某个指标暂时变好,并把这些结果转化为下一步行动的依据。

最后,这个过程必须能够持续循环,形成一个Loop。这样,上一轮的结果能够进入下一轮,新的方案可以反复运行、比较和迭代,失败也不会让整个实验失去恢复和重来的能力。

归结起来,就是环境、反馈和循环。这也是前面讲的DeepSeek、Google等公司在尝试创建的条件。

这也解释了为什么马斯克近期花600亿美元买下Cursor后,Grok大有逆袭之势。

Cursor是一个代码编辑器。SEC文件给出的收购理由是,软件开发同时具备高质量的结构化数据、快速的反馈周期和高频使用。AI编程留下的工作轨迹,能反过来改善模型的训练和性能。

简单来说,当用户用AI写代码,Cursor会记录它在哪一步卡住,要怎样补救等等。工程师再把这些行为轨迹和反馈结果加工成训练模型的数据。

所以,马斯克真正想买的是AI进入真实工作环境后的反馈和循环。而这些反馈和循环,也将是接下来AI公司的竞争重点。也许会有更多公司开始复制马斯克的做法,通过收购拿到这些资源。与此同时,原本掌握高价值业务场景、产品入口和用户规模的公司,也会显示出更大的优势。

当然,RSI目前还只是远方的一个目标,业内还有质疑之声。华盛顿大学教授Pedro Domingos认为,从LISP在1950年代出现开始,AI就已经具备某种构建自身的能力。这种自我改进究竟会带来递增回报还是递减回报,目前在他看来并没有足够证据证明前者。

此外,还有一个更深远的问题。60年前,当I.J. 古德把超智能机器叫人类最后一项发明,他给出的一个前提是:机器得一直肯听人的话,人可以随时关掉它。

那么,如果AI真的能够通过RSI不断加速,实现能力指数级增长后,人类还攥不攥得住那个开关?

简体中文 English