9 月 19 日,arXiv 上多了一篇 31 页的新论文。
标题是《DSec:面向大规模智能体训练的高效沙箱基础设施》。
通讯作者是梁文锋。
论文第一次把团队内部的自动化沙箱摊开讲。
那套系统专门伺候智能体的强化学习和评测。
它能在秒级给每一次训练任务开出一个独立的虚拟考场。
规模数字很硬。
一天跑 300 万个沙箱环境,单个生产单元横跨 160 个计算节点。
沙箱的权限被层层切开,里面的模型没法偷看答案。
它走过的每一步环境反馈,都能被精确复现。
沙箱的位置很特殊。
它不算模型,也不算数据集,只是训练时踩的那块地基。
可这块地基现在成了瓶颈。
智能体要反复试错,就得先出得起那么多可执行环境。
以前的沙箱是为验证代码准备的,不是为培养智能体准备的。
过去三年,梁文锋的名字出现在 11 篇论文里。
他很少挂在旗舰模型的大报告上。
V3.2 和 V4 这些上百人署名的报告里,都找不到他。
他签名的位置,都在更下面一层。
注意力机制。专家路由。网络拓扑。推理算子。智能体沙箱。
三年下来,这 11 篇串成了一条线。
每一次出手,都落在最底层、最硬核的地方。
一、买不起一万张显卡,那就打效率战
2024 年初,行业陷在算力的军备竞赛里。
稠密模型的缩放定律,几乎等同于烧钱定律。
万卡集群和数亿美金的门槛,把赛道圈成了巨头俱乐部。
能坐上牌桌的,就那么几家超级巨头。
GPT-4 这个级别的模型,要用掉上万张高端显卡。
单次训练的物料成本超过 6300 万美元。
沿着巨头定下的路线追,初创公司只能活在别人的影子里。
换条路线才行。
那年,明星开源公司 Stability 扛不住云租赁账单。
资金链断裂,负责人离职。
另一家明星团队 Inflection 也没撑住,3 月核心团队被微软反向并购。
牌桌在缩小。
国内那些在 2023 年喊过百模大战的团队,撞上万卡门槛时只剩作坊规模。
梁文锋的第一枪,打在了算力与能力线性绑定这条规则上。
2024 年 1 月 5 日,《DeepSeek LLM》发布。
这是团队在全球开源社区的首秀。
论文给出的结论很反直觉。
算力固定的前提下,盲目扩参数不是最优解。
把数据质量和数据密度的配比提上去,反而能拿到更强的模型。
训练用了 2 万亿优质中英双语 token,训出 7B 和 67B 两个版本。
67B 那一版在代码和数学基准上全面反超当时的开源标杆 Llama-2 70B。
开放 AI对话 测试里,它赢过了 GPT-3.5。
紧接着是《DeepSeekMoE》和《DeepSeek-V2》。
这两篇把传统架构重做了一遍。
细粒度专家动态路由,加上共享专家隔离。
每个 token 只调用少量专家参与计算。
训练开销直接降了 42.5%。
首创的多头潜在注意力,用低秩潜在向量做压缩。
长上下文推理最贵的缓存体积,被压掉了 93.3%。
基于这两项突破的 V2,性能比肩 GPT-4,成本却低得离谱。
千 token 的推理成本被打到此前的几十分之一。
国内大模型的接口价格战,就是从这一枪开始烧起来的。
二、把低成本路线推到闭源模型的高地上
第一阶段解决的是能不能用。
第二阶段,他把这条低成本路线推到了极致。
2024 年 6 月,《DeepSeek-Coder-V2》出手。
那时候,开源模型在 AI编程 这件事上一直追不上闭源。
原因有两层。
高质量代码数据稀缺,老架构的算力效率又低。
闭源厂商手里握着几万张旗舰显卡,可以不计成本地堆能力。
团队的做法是另外注入 6 万亿中英代码与数学数据,做持续预训练。
支持的编程语言从 86 种扩到 338 种。
上下文窗口直接拉满到 128K。
在 HumanEval 和 Codeforces 这些基准上,它第一次全面超过了闭源旗舰。
价格表更刺激。
每百万 token 输入 0.14 美元,输出 0.28 美元。
对手那边,输入要 10 美元,输出要 30 美元。
差不多是百分之一。
高端代码智能的调用成本,被打到了水电费的量级。
2024 年底,《DeepSeek-V3》是架构的超大规模验证。
不到两个月,2048 块 H800 从头训出一个顶级模型。
参数 671B,总成本 560 万美元。
这个数字让硅谷很不舒服。
有分析机构出来泼冷水,说这 560 万美元只是纯烧电训练的最浅层账单。
研发亏损和卡群折旧,还有十几亿美元的基础硬件大账,都没算进去。
但拦不住大家拿这张收据去对比动辄募资千亿的对手。
秘密藏在论文里的三件事。
一是无辅助损失的专家负载均衡,让所有专家分到一样多的活。
二是更精简的 FP8 数值精度,把显卡的计算效率拉满。
三是让数值计算和数据传输同时启动,把硬件空闲时间压到接近于零。
2025 年春节,《DeepSeek-R1》落地。
核心是组相对策略优化。
它第一次严谨证明了一件事。
不做大规模监督微调,纯强化学习也能让模型长出链式思考。
零冷启动的版本完全不用人工标注数据。
整个强化学习阶段只花了 29.4 万美元。
成果后来登上《自然》杂志封面,成了第一个拿到这份认可的主流大模型成果。
西方主流媒体密集跟进,讨论的是出口限制为什么没能挡住这条路。

央视《新闻联播》的画面
同年 2 月,《原生稀疏注意力》把战场下沉到了芯片的访存逻辑。
团队没有停在应用层做小修小补。
他们用底层算子语言重写了最硬核的计算路径。
稀疏计算的访问节奏,被精准对齐到显卡内部的计算单元。
结果很直接。
前向传播速度提升 9 倍,长序列解码速度拉高 11.6 倍。
这篇论文拿下 ACL 2025 最佳论文奖,也成了下一代长上下文模型的标配方向。
2025 年 6 月,另一篇论文从计算机体系结构视角出发。
它拆开大规模专家混合训练的内存墙和通信墙。
注意力机制和路由策略怎么跟硬件协同,也被它讲清楚了。
最后还给下一代 AI 加速芯片留了一份设计建议。
中国大模型的工程经验,第一次变成了全球芯片行业可以照着用的参考。
三、当模型冲进无人区,用数学重构底座
2025 年末,模型规模冲到千亿级,网络层数突破上百层。
行业进了一片没有经验可循的无人区。
竞争也从参数规模的比拼,变成了深层网络拓扑的数学命题。
过去十年,全行业都在用经典的残差连接。
它像一条保留直通车道的公路,让前一层的信号原封不动流向深层。
模型做到极深极宽之后,这条范式触到了天花板。
数值稳定性不够,梯度在百层传递里消散或者失控暴涨。
训练中经常出现损失值突增,一次失控就能让几千万的算力打水漂。
学界提出过超连接架构,相当于把单车道升级成多线并行的高架立交桥。
这种架构缺少数值边界约束,信号越传越偏,深层训练极容易发散。
它一直停在实验室里,没能大规模落地。
缺口就在数值边界。
2025 年 12 月 31 日,《mHC》给出了一个很优雅的数学解法。
流形约束超连接要求所有层间交互映射矩阵,严格落在一片特定的数学区域里。
那片区域由双随机矩阵构成,叫作多面体流形。
不管多少路信号在层间怎么交叉融合,整体的数值尺度始终守恒。
这一步,已经从拓扑层面重新定义了深层网络的连接规则。
四、把战火烧到智能体的基础设施层
2026 年,行业的注意力都放在智能体身上。
大家盯的是推理能力和工具调用这类显性指标。
梁文锋盯的是更下面的一层。
2026 年 6 月,《DSpark》讲的是生成速度。
它不去压榨单个算子的计算速度,而是动态调整生成节奏。
有把握的地方就提速,容易出错的地方就慢下来。
把事后补救变成事前规避。
在高并发场景下,每个人的生成速度提升 60% 到 85%。
推理效率的比拼,从谁的芯片更快,变成了谁的调度更聪明。
另一半是沙箱。
智能体的强化学习需要在可执行环境里反复试错。
百万级的交互迭代,就要有百万级的沙箱环境。
传统沙箱方案启动慢,密度低,成本也高,安全隔离还差。
它们是为验证代码设计的,不是为培养智能设计的。
9 月发布的 DSec,每天能跑大约 300 万个沙箱。
并发承载 38 万个实例。
内置的防作弊机制保证训练数据是真的。
在这之前,各家的智能体沙箱都是内部定制的黑盒。
没有统一标准,也没有公开的生产级方案。
DSec 把这件事摊到了台面上。
同行还在打磨单个智能体的任务能力时,他已经在搭能支撑百万级并行训练的底座。
五、真正的狙击手不炫耀口径
回望三年,这 11 篇论文从成本战出发,专挑最底层下手。
专家混合重构了算力成本。稀疏注意力击穿了长上下文瓶颈。
R1 颠覆了推理范式。mHC 筑牢了数学底座。
DSpark 榨干了推理效率。DSec 卡位了智能体基础设施。
路线很清楚,每一步都踩在技术演进的节点上。
有一点值得留意。
他从来没有把笔墨花在模型参数表的攀比上。
与其在参数上多加一个零,不如把同样的钱花在数据和架构的配比上。
图省事就把沙箱当成安全配件,那就看错了它真正的位置。
对普通用户来说,这些底层变化最后都会落到手里的 AI工具 好不好用。
真正的狙击手,不炫耀枪支的口径,也不比拼弹药的数量。
他只关心一件事。
用最精准的打击,完成最致命的突破。
