DeepSeek发表论文揭示Agent训练的基础架构

2026-09-24 8966

9月19日,一篇署名梁文锋的论文在arXiv网站上发布。这篇论文并非探讨模型本身,而是将目光投向分布式计算领域,其分类为cs.DC,而非传统的cs.LG或cs.AI。该文共31页,包含13幅插图,并且由高达131位作者共同撰写。其内容源自一篇已通过首轮审稿的两页扩展摘要,原本是提交给ACM SIGOPS ATC 2026的操作系统方向(OSC Track),而这次则是经过大幅扩展后呈现的完整版本。

论文的标题为《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,主要聚焦于DeepSeek内部为Agent训练提供支撑的基础设施DSec(DeepSeek Elastic Compute),这是一个专为生产级沙箱搭建的平台。文中指出,从DeepSeek-V3.2到V4.1的所有Agent型强化学习训练、评估及环境构建的负载,均是在此平台上运行。论文通过将长期以来被视为“黑箱”的Agent执行环境,转换为一个与强化学习框架协同运作的生产级平台。

about image

论文的核心亮点可以用五个要点概括:首先,这个平台的规模庞大,每个单位约由160个CPU节点组成,拥有3万个核心和250TB的内存,每天能够提供大约300万个沙箱服务,达到峰值并发超过38万个,创建沙箱的速率高达5000个每秒;其次,环境组合方式将基础镜像、工作区及工具包拆分为独立的、版本控制的只读层,从而将维护成本从O(m·N)降低为O(m),并且只需对dockerd修改30行Go代码;第三,极限超卖策略使得90%的沙箱平均CPU性能不足5%,但通过内存共享和QoS调度,能够将单节点的容器数量压至3200个;第四,镜像按需加载方式只在运行时调用4.2%至13.3%的只读镜像数据,从而在8192个容器的突发场景中实现1.71倍的速度提升,并减少57%的磁盘写入;最后,论文首次公开了在沙箱中Agent进行“抄答案”和“搞破坏”的真实案例,并展示了AppArmor与eBPF的边界应对机制。

about image

在当今行业竞争激烈、各方都在追求模型能力和Agent框架的背景下,DeepSeek通过这31页的论文强调了一个更为基础的观念——Agent的能力在很大程度上取决于其所处的沙箱环境。DSec可以被总结为为Agent提供一个透明可伸缩的隔离执行环境,并强调没有一种沙箱可以满足所有Agent的需求。因此,DSec拒绝了“一种运行时包打天下”的构想,采用统一SDK以提供四种后端,让用户可以根据任务需求选择合适的执行环境。

论文详细描述了四种沙箱后端,通过一个统一的Python SDK(libdsec)进行呈现。值得注意的是,这些容器和microVM并非直接运行在裸机上,而是通过QEMU/libvirt虚拟机实施,多一层隔离,增强安全性。而图形相关负载则采用宿主hypervisor的半虚拟化GPU并通过兼容层处理。此外,论文也坦诚指出,虽然libdsec提供一种统一的框架,但四种后端的启动成本、隔离边界及其文件系统语义等依然各异,最终的选择仍在于调用者。

about image

论文还提到,真实的挑战并不在于启动沙箱,而在于如何同时“供给”数万个沙箱,因为Agent RL的流量并不是平滑而来的。研究表明,一个训练任务最多可同时申请大约3.2万个沙箱,而这些沙箱并不共享同一环境,可能依赖于不同的代码库、操作系统及工具链等。在一周的生产数据中,活跃的环境资产甚至超过了130TB。在这种情况下,很多镜像只被少数任务使用,导致单个镜像的复用率低,这与传统云计算面临的情况截然相反。

推荐产品