据华尔街见闻报道,DeepSeek在一篇系统论文中披露了内部沙箱平台DSec。论文称,从DeepSeek-V3.2到V4.1,全部Agent强化学习训练与评测的沙箱负载都运行在DSec上。这里披露的是训练和评测所用的基础设施,而非模型能力的测试结果。
DSec为Agent任务提供隔离的执行环境。报道列出的负载包括判题、软件工程、安全渗透和电脑操作;研究者可通过统一SDK,按任务选择短时函数调用、容器、Firecracker微型虚拟机或完整虚拟机。
规模方面,报道引述论文数据称,DSec每天服务约300万个沙箱实例,峰值并发超过38万个,创建速率超过每秒5000个;单个训练任务一次最多可启动3.2万个沙箱。
为处理不同任务所需的环境与资源,论文介绍了可组合环境层、通过3FS按需读取EROFS镜像,以及内存共享与回收等设计。报道还称,DSec与强化学习框架协同,支持有状态Agent执行循环的暂停、恢复和迁移。
仅供信息参考,不构成投资建议。
