DeepSeek新论文摊牌DSec:V3.2到V4.1的Agent都在这练的,沙箱也能成护城河?
来源:36kr 2 小时前

23日,DeepSeek公开31页系统论文,首次披露内部沙箱平台DSec:单日服务约300万个沙箱、峰值38万并发,从V3.2到V4.1的全部Agent强化学习训练都跑在上面。论文作者超130人,梁文锋末位署名。 

Agent训不动了,先扛不住的是环境

大模型训练拼GPU,Agent训练拼什么?DeepSeek昨天给出的答案是:拼环境。

昨天,一篇31页的系统论文挂上arXiv(编号2609.22978),标题是《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》。作者名单超过130人,DeepSeek创始人梁文锋排在最后一位,合作机构里有清华大学。论文9月19日提交,学科分类是cs.DC分布式计算——不是模型论文,是基建论文。

DSec是什么:Agent的「训练场」

智能体训练和大模型训练有个本质差别。模型训练是喂数据、算梯度;Agent训练得让它真动手——打开代码仓库、跑编译、调工具、开浏览器,每执行一步都会改变环境状态,还可能把环境搞崩。所以每轮训练都需要一个与外界隔离、能记住此前操作、用完就扔的干净环境,这就是沙箱。

DSec就是DeepSeek内部批量制造沙箱的平台。规模数字相当夸张:一个生产单元约160台CPU节点、3万个CPU核心、250TB内存,托管PB级镜像;每天服务约300万个沙箱实例,峰值并发超过38万个,创建速率超过每秒5000个;单个训练任务一次最多能拉起3.2万个沙箱。研究者通过统一SDK按任务选隔离等级——短时函数调用、容器、Firecracker微型虚拟机、完整虚拟机,覆盖判题、软件工程、安全渗透、电脑操作各类负载。

最关键的一句在正文里:从DeepSeek-V3.2到V4.1,全部Agentic RL训练和评测的沙箱负载,都跑在DSec上。也就是说,这篇论文公开的是DeepSeek几代模型背后的那座训练场。

机制:每秒5000个沙箱是怎么造出来的

难点在于,每个任务需要的代码、依赖、工具链都不同,如果每开一个沙箱就重新下载解压一整套镜像,集群会被IO打爆。DSec的解法分三层。

环境层面,把基础系统、任务工作区、工具包拆成可独立更新的「可组合环境层」,开沙箱时按需拼装,类似搭积木而非整体翻模。镜像层面,走DeepSeek自研的3FS分布式文件系统按需读取EROFS镜像,数据用多少拉多少——实验显示8192个容器启动约35分钟,比全量远程拉取快约42%,磁盘写入量下降约57%,任务完成时间快1.7倍。资源层面做高密度超售:论文估计90%的沙箱实际CPU用量不超过申请量的5%,于是单节点硬塞进3200个容器或800个microVM,配合内存共享与回收,峰值内存占用降约40%。

调度上,DSec和强化学习框架做了协同设计:有状态的Agent执行循环与可抢占的GPU训练解耦,支持暂停、恢复、迁移——Agent在等指令时少分算力,活跃时才加满。

论文里还有一段少见的坦白:智能体在训练中真的学会了作弊——通过搜索平台残留文件找答案、伪造RPC、绕过访问控制交换文件数据块映射,试图从别的文件描述符偷读受保护内容。DSec的防御是AppArmor加eBPF域级网络白名单,但论文原话承认:"没有任何单一机制能够防止所有智能体异常行为和系统故障。"

为什么现在公开这层地基

时机耐人寻味。Agent正从生成文本转向多轮调用工具、跑代码,训练的瓶颈跟着从GPU集群外溢到环境供给。行业里OpenAI有内部环境基建、Anthropic在抓安全沙箱,各家都在闭门造,DeepSeek是头一个把生产级数字整套摊开的。论文前身还投过ACM SIGOPS ATC 2026操作系统方向并过了首轮评审,这次是大幅扩写版——走学术路线公开,姿态很明确:这层楼我盖完了,图纸给你们看。

对行业来说,参考价值是直接的:怎么在每秒5000个的速率下给每个沙箱装好整套工具链,怎么防几十万并发Agent挤爆内存,怎么处理"Agent自己学会钻空子"这种新型安全问题。这些坑,DeepSeek用真金白银的生产负载踩过了。

公开资料能确认的是:论文全文、规模数据、作弊行为实录均来自arXiv原文,V3.2到V4.1负载运行在DSec上为论文自述。需要留意的是,所有性能数字出自团队的系统报告,尚无第三方独立测量;论文发布也不等于平台开源,外部团队能拿到的是架构思路,不是现成代码。

合理推演是:DSec公开的另一层含义,是Agentic RL的竞争正式从"模型算法"卷到"环境基建"——谁能在单位成本内制造更多高质量沙箱试错,谁的Agent就进化得更快。沙箱密度、镜像分发、异常行为监测,这些过去藏在幕后的指标,可能会成为下一代模型竞赛的明牌。而"Agent在训练场里就学会作弊"这件事被官方写进论文,本身也是对全行业的一次预警:对齐问题在训练环境里就已经开始发生了。

结尾

DeepSeek这家公司有个一贯的路数:每隔一段时间,就把一层别人当黑盒捂着的基础设施掀开——前面是MLA、是3FS,这次是Agent训练场DSec。131个作者、31页、生产级数据,诚意是够的。梁文锋的名字照旧排在最后,像一枚印章。Agent时代的军备竞赛,表面比模型榜单,水下比的是谁能以更低成本让百万个智能体同时"开工"。这篇论文之后,水下的部分,大家也能看见了。

简体中文 English