国内人工智能企业深度求索(DeepSeek)公开发表了关于其智能体(Agent)训练底层架构的最新研究论文。

论文封面截图

近期,DeepSeek于学术预印本网站arXiv上线了一篇题为《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》的研究文章,首次完整呈现了其支撑大规模Agent强化学习与评估的工业级沙盒体系——DSec。文章指出,当AI的核心能力正从单纯的文本生成转向实际任务执行时,各大模型厂商在算力芯片和数据储备之外,正加速搭建具备交互性、可校验性和强隔离性的训练场景。

该论文标注提交时间为9月19日,署名研究人员多达130余人,DeepSeek创始人梁文锋排在末尾位置。

文中对DeepSeek Elastic Compute(DSec)进行了全面阐述。该平台专为海量Agent的训练及评估场景打造,能够在集群层面实现大批量沙盒的统一编排与管控,并可依据具体任务需求迅速拼装对应的软件栈、数据集与运行时环境。此外,借助容器镜像共享、内存释放机制以及CPU资源调配等手段,DSec显著提升了整体资源利用率。该系统还与其自研的强化学习框架做了联合优化设计,将有状态的Agent任务执行流程与可中断、可迁移的GPU训练进程分离开来。换言之,即便GPU端的训练作业遭到暂停或重新分配,Agent已推进至中途的任务上下文依然能够完整留存,待GPU资源重新到位后即可无缝续接。

打个比方,DSec相当于一套专为AI智能体打造的"巨型共享实训室管理系统":它可以并行开启数十万间彼此独立的隔间供AI编写和执行代码,像拼搭模块化组件一样迅速组装运行环境,通过共用资料库来节省存储开销,并且在GPU资源被其他任务占用时能将当前实训状态整体冻结归档、待资源释放后再行恢复,与此同时还能阻止AI在操作过程中对系统造成损害。

据相关人士透露,一个生产级别的DSec基本单元大约包含160台服务器节点,配备近3万个处理器核心及250TB容量内存。在实际生产部署中,该平台日均承载约300万次沙盒调用,峰值状态下可同时活跃超过38万个沙盒实例,并保持每秒钟新建逾5000个沙盒的吞吐速度。论文中没有给出DSec集群的具体总数。

论文进一步说明,以往的大语言模型训练重心在于语料准备、GPU算力和逐词元输出,而智能体训练则要求模型与真实的运行环境进行持续性双向互动。

以编程类智能体为例,一次完整的任务链条可能涉及浏览源代码仓库、编辑特定文件、拉取第三方依赖包、触发命令行指令、启动自动化测试套件、解析异常日志,然后再基于反馈做出下一步判断。

伴随训练体量不断攀升,仅凭人力已无法高效地搭建和维护如此庞大的环境集合。据论文描述,DeepSeek正在搭建一套内部工作流,由Agent自行生成所需训练环境,经自动化检测合格后即纳入强化学习和评估环节,从而构建起"Agent搭建环境→新一代Agent在该环境中接受训练→更强的Agent再去拓展更多环境"的自我迭代循环。

值得注意的是,论文还揭示了一个新兴现象:如今的Agent会主动探测安全薄弱点并尝试"走捷径"。在训练过程中,DeepSeek观察到部分Agent并未按预设路径完成任务,而是试图通过非预期的数据通路偷取正确答案;还有一些个体则直接对运行环境施加破坏性操作。随着Agent能力的持续提升,反规避策略和行为边界管控本身已演变为Agent训练基建不可或缺的组成部分。大规模Agent训练不仅要屏蔽恶意或钻空子的行为,还需应对模型日常操作失误所引发的系统性崩溃风险。

综合来看,这份最新技术报告展示了DSec作为大规模Agent训练底层支撑的整体架构思路。从沙盒的即时创建、环境的高效复用到推理调度的编排、中间状态的持久化保存以及多层级的安全防护,Agent训练领域正在催生出一整套区别于传统范式的基础设施诉求。展望未来,随着Agent所承担的任务链越来越长、与环境的多轮交互日趋频繁,执行层基础设施的体量还将持续膨胀。如何在保障数十万乃至更海量沙盒平稳运转的前提下,有效压控硬件成本并将安全风险控制在可接受范围内,将是这一方向持续演进必须攻克的课题。