DeepSeek 在知乎独家发布技术长文,首次系统阐释了支撑 DeepSeek-V4 全部训练、评测与数据预处理流程的沙盒基础设施——DeepSeek 弹性计算(DSec)。相关技术报告已公开至 arXiv,由 DeepSeek 联合清华大学发布,作者团队超过 130 人,梁文锋也位列其中。
要训练一个可靠的 Agent 大模型,需要让模型在真实环境里反复试错:阅读代码、修改文件、安装依赖、执行测试。这些操作会不断改变环境,沙盒必须在多轮交互中持续保留状态。这类负载的特点是创建请求脉冲式突发、启动后 CPU 大部分时间闲置而内存需持续驻留,这些直接决定了 DSec 的设计。
四种后端与分层环境
DSec 支持 FnCall、Container、MicroVM 和 Full VM 四种执行后端,通过统一的 Python SDK 接入,按任务类型选择:在线评测等短任务复用容器,安全任务用 MicroVM,需要图形界面和 Android 应用的场景用完整虚拟机。环境则拆为基础镜像、工作区、工具包三层分别管理和组合,以 2026 年某一周的生产数据为例,容器后端使用了 11266 个基础镜像、102171 个工作区以及数百个工具包。按传统方式,上述任意一部分更新或替换,都会导致大量镜像重建;DSec 用 EROFS 格式存储并支持跨镜像去重,创建沙盒时通过 OverlayFS 按需组合各层,更新时只需重建发生变化的镜像层。
在资源利用上,分析发现沙盒运行时实际访问的数据量仅占镜像总大小的 4.2% 至 13.3%,因此 DSec 把镜像数据放在 3FS 分布式文件系统上按需读取,让 I/O 开销随实际使用的数据量缩减。
这篇长文揭示了前沿模型竞争的另一面:拼的不只是算法,还有底层基础设施的工程效率。对搭过本地渲染农场或批量出图流水线的从业者来说,这种按需加载、分层复用的思路是相通的。