DeepSeek新论文揭示大规模Agent训练的核心基础设施
9月19日,arXiv发布了一篇署名梁文锋的论文,这篇论文属于分布式计算领域,而非传统的机器学习或人工智能分类。该论文共有31页,包含13幅图表,作者团队有131名成员,最初是投稿给ACM SIGOPS ATC 2026的两页扩展摘要,现已经过首轮评审,并进行了显著扩展。
论文的标题为《DeepSeek Elastic Compute (DSec): 一种用于有效大规模Agent训练的沙箱基础设施》,作者团队来自DeepSeek-AI以及清华大学。该论文介绍了支撑DeepSeek内部Agent训练的部署底层,即DSec,这是一个生产级的沙箱平台。文中明确表示,从DeepSeek V3.2到V4.1的所有强化学习训练、评估和环境构建都依赖于这个平台。
论文的核心亮点可以概括为五个要点:首先,单个规模单元包括约160个CPU节点、30000个核心和250TB内存,可每日提供约300万个沙箱服务,峰值并发达到38万以上,创建速度为5000多个每秒;其次,环境组合方面,通过独立版本化的只读层进行基础镜像、工作区和工具包的拆分,降低了维护成本;第三,系统实现极限超卖,尽管90%的沙箱平均CPU使用率低于5%,通过内存共享和QoS调度,单节点能够承载3200个容器;第四,镜像按需加载策略使得运行时读取的镜像数据仅为4.2%到13.3%,大大减少了磁盘写入;最后,论文首次展示Agent在沙箱中执行的真实案例,包括如何破坏和伪造数据,以及相应的安全防护措施。 球友会
论文强调,在持续竞争模型能力和Agent框架的背景下,Agent的性能上限在很大程度上受到底层沙箱的影响。DSec被定义为Agent所需的可弹性扩展的隔离执行环境,并且不再采用“一种运行时适应所有任务”的单一方案。DSec通过统一SDK提供四种后端供任务选择,确保为不同的任务提供合适的执行环境。
有趣的是,容器和microVM并不是直接在裸机上运行,而是在QEMU/libvirt虚拟机中,以提供额外的安全保障。论文也坦诚,libdsec并非一个语义上的统一抽象,各种后端在启动成本、隔离边界和文件系统等方面的差异需由调用方自行决定。
随着系统问题的回归,2026年奇点智能技术大会将于11月20日至21日在北京举行,届时将探讨Agent训练与执行环境等多种技术议题,并邀请一线研究者分享经验。 球友会
论文指出,最大的挑战在于为数以万计的沙箱同时提供服务。统计结果显示,一个训练任务最大可同时申请约32000个沙箱,这些沙箱中的环境并非复制,而是依赖于不同的代码仓库、操作系统等。生产数据分析表明,一个星期内的活跃环境资产超过130TB,且许多镜像的复用率较低,导致与传统云计算的镜像分发逻辑相违背。