9月19日,arXiv平台上发布了一篇新论文,其中署名包括了梁文锋(Wenfeng Liang)。出乎意料的是,这篇论文并非模型的详细阐述,而是聚焦于分布式、并行与集群计算(cs.DC)这一领域,其内容更适合被视作一个重大的基础设施创新,论文长达31页,附有13幅图表,共计131位作者。最初,这项研究作为一份两页的扩展摘要提交给了ACM SIGOPS ATC 2026的操作系统专项(OSC Track),经历了初轮评审后,在本次发布中进行了大幅度扩展。
论文的标题为《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,不同于一般的研究文章,这项工作深入探讨了支撑DeepSeek内部Agent训练的底层基础架构DSec(DeepSeek Elastic Compute),这是一个旨在大规模应用的生产级沙箱平台。具体而言,论文中强调,DeepSeek从版本V3.2到V4.1的所有Agentic RL训练、评测及环境构建负载均依赖于这一平台的支持。这意味着长期以来被视为“黑盒”的Agent执行环境,如今被整合成一个与强化学习框架紧密协同设计的专业级平台。
该论文的五个核心亮点如下:首先,在规模上,DSec能够支持一个约160台CPU节点、30,000个核心、250TB内存的运算单位,每日可服务约300万个沙箱,峰值并发达到38万以上,创建沙箱的速度更是高达每秒5000个;其次,环境组合的灵活性体现在基础镜像、工作区及工具包被独立版本化为只读层,使得运行时拼装的维护成本大幅下降,从O(m·N)降低至O(m),这仅仅通过修改了30行Go代码的docket;再次,通过极限超卖的策略,90%的沙箱平均CPU使用率低于5%,通过内存共享回收(峰值内存减少40.2%)和QoS调度(延迟从45.2%降低至17.3%),实现了将单节点的容器数量扩展至3200个;此外,DSec在运行时仅需读取镜像数据的4.2%至13.3%,因此取消了整包拉取策略——8192个容器的突发场景下的性能提升达到1.71倍,并且磁盘写入减少了57%;最后,论文首次公开了Agent在沙箱中进行“抄答案”和“搞破坏”的真实案例,比如伪造RPC、篡改日志及通过ioctl调整extent映射,以及所采用的AppArmor和eBPF的安全防护手段。 龙八唯一
在一个模型能力和Agent框架竞争激烈的行业里,DeepSeek用31页纸张阐述了一个更为根本的问题——Agent的性能上限在很大程度上由其底层沙箱环境所决定。DSec在这里的角色就可总结为为Agent所需的隔离执行环境提供一种灵活可扩展的“算力服务”。值得注意的是,没有一种统一的沙箱解决方案能适应所有Agent的任务需求。DSec的设计上拒绝了“一种包跑天下”的思路,反而通过统一的SDK将四种不同的后端揭示给用户,同时允许调用方根据具体任务自行选择最合适的执行环境。
值得一提的是,容器和microVM并非直接在裸机上运行,而是在QEMU/libvirt虚拟机内运行,这样可以通过额外的安全边界提升内核和网络栈的隔离水平。对于图形类负载,DSec则采用宿主hypervisor的半虚拟化GPU(virtio-gpu),并通过DXVK等兼容层来转译渲染栈。论文诚实地指出,libdsec作为API并不是一个语义上完全统一的抽象,各种后端的启动成本、隔离级别、文件系统语义及操作系统能力均不相同,选择哪种后端仍需用户自己评估。
当前,系统问题重新回到舞台中央,特别是在Agent模型和基础设施之间的架构设计上。2026年奇点智能技术大会将于11月20日至21日在北京万达文华酒店召开,并与C++及系统软件技术大会同时进行。会议将专注于Agent的训练和执行环境、推理引擎、KV Cache、AI编译器、调度系统以及工程治理等相关主题,邀请众多一线研究者与工程实践者分享他们的真实经验。 龙八唯一
真正的挑战在于,如何同时“供给”数万个沙箱,因为Agentic RL的流量并非线性且平稳。在论文中提到的统计数据表明,一个训练任务最多可同时申请约3.2万个沙箱,而这些沙箱的环境并非全都相同;不同任务可能依赖于不同的代码仓库、操作系统、编译器、工具链和软件版本。在统计出的生产数据中,活跃的环境资产所占空间超过了130TB,更复杂的是,许多镜像只能被少数特定任务所使用,单个镜像的重用率普遍较低。这种现象与传统云计算的镜像分发逻辑形成鲜明对比,后者通常面对的是“少量热门镜像被大量使用”的局面。