
当行业还在纠结大模型是继续堆稠密参数还是在混合专家MoE路线上打磨工程实现的时候DeepSeek‑V3技术报告的发布给开源大模型领域投下了一枚重磅信号弹。很多人第一眼看到这份报告目光会直接锁定那组亮眼的评测数字671B总参数每个token只激活37B参数在数学代码多项基准上追平甚至超越不少闭源模型。但如果只盯着跑分看其实会错过这份文档真正的内核。这篇技术报告的价值不完全在于刷出更高的榜单分数而是完整展示一套从模型架构创新训练框架重构FP8低精度落地后训练对齐再到推理部署全链路的工程解决方案。不少做过大模型训练的工程师都明白一个现实纸面的架构设计和真正跑通万亿token规模训练之间隔着巨大的鸿沟。很多论文提出的MoE新思路仅仅停留在小规模消融实验一旦扩展到数百B数千B参数规模就会冒出负载失衡通信爆炸训练震荡数值不稳定等一堆棘手问题。DeepSeek‑V3的特别之处就在于它不是简单把过往模块拼接叠加而是针对MoE长期存在的各类顽疾给出经过大规模实跑验证的答案。我们顺着这份报告的脉络跳出冰冷的指标表格去理解这一代MoE模型背后取舍创新还有尚未完全解决的现实难题。MoE进化路上绕不开的老难题DeepSeek‑V3给出不一样的解法混合专家模型MoE并不是一个新鲜概念早在Switch Transformer时代学术界就已经意识到不需要让每一个token都驱动全部参数只激活一部分专家网络就可以用更低计算成本获得更大模型容量。但这么多年MoE大规模落地始终有两道绕不开的坎第一个是专家负载均衡问题第二个是推理阶段KV缓存爆炸带来的开销。过去很多MoE方案为了解决专家负载倾斜普遍采用辅助损失Auxiliary Loss在主损失之外额外增加一项约束强制各个专家被调用的频次尽量接近。这种做法简单直接但副作用十分突出。辅助损失相当于给模型的优化目标增加了额外约束模型在学习语言本身规律的同时还要被迫去满足负载分配的规则。报告的消融实验已经清晰展现这个问题纯依靠辅助损失做负载均衡的基线模型会在一定程度上损害模型本身能力。相当于为了工程上的负载平衡牺牲一部分模型的表达潜力。DeepSeek‑V3提出无辅助损失的负载均衡策略就是试图跳出这个两难局面。它不再依靠损失函数来约束路由结果转而给每一个专家维护一个可动态调整的偏置项bias。偏置项只参与路由选择的打分不会介入前向传播里门控权重的计算。训练的每一步结束之后统计整批样本各个专家的负载情况如果某个专家过载就调低它的偏置如果负载不足就调高偏置。依靠这种动态调参在批量维度实现专家负载均衡。这里有一个很关键的细节这套方案并不是完全抛弃所有平衡约束。为了避免单条序列内部出现极端负载失衡依然保留一个权重极小的序列维度平衡损失只是它的权重被设置得非常低仅仅作为兜底防护。消融实验的数据能够直观看到变化同样的参数量训练token数量不变的前提下无辅助损失版本在HumanEvalGSM8KMATH等关键基准上全部取得了正向收益。更深一层看这套方案带来的变化不只是跑分上涨。报告附录中提供多组专家负载热力图可以观察到一个有意思现象无辅助损失策略训练出来的模型专家的领域特化程度明显更高。不同领域文本比如维基百科Github代码数学文本会倾向于激活不同的专家。反观依靠辅助损失约束的模型各个专家被强行拉到相近负载反而抑制专家形成领域专精。专家不再被强制平均分配部分专家专门负责处理数学逻辑部分专家擅长代码语法这种专业化分工正是MoE架构理论上应该具备的优势却被传统辅助损失压制住。当然批量维度的负载均衡也不是没有隐患。当测试数据和训练数据分布出现偏移的时候推理阶段有可能出现负载倾斜。DeepSeek团队没有试图在架构层面把所有问题全部解决而是选择拆分问题训练环节保证批量维度负载推理部署环节通过冗余专家的工程手段去应对分布漂移这是很务实的工程思维不会指望一个算法搞定全流程所有问题。除了负载均衡继承自V2版本的多头隐式注意力MLA继续解决MoE模型推理的另一大痛点KV缓存膨胀。稠密大模型推理成本很大一部分开销来自KV缓存MoE模型虽然前向计算参数量下降但注意力模块依然是稠密的如果沿用标准多头注意力长上下文场景下KV缓存内存占用依旧居高不下。MLA对key和value做联合低秩压缩只需要缓存压缩后的隐向量以及带旋转位置编码的解耦key极大压缩KV缓存体积。同时对query也做低秩压缩降低训练时激活内存。这套设计经过V2版本验证之后在V3继续沿用是MoE模型能够落地实际业务不可缺少的一块拼图。在基础MoE与MLA之外DeepSeek‑V3引入多token预测MTP作为新的训练目标。以往大模型训练几乎清一色是单步下一个token预测模型每一个位置只学习预测紧随其后的1个token。MTP的思路是让模型同时预测未来连续多个token。很多人会误以为MTP只是推理加速工具但报告反复强调MTP首先是训练目标推理加速只是附带红利。实现上它和EAGLE这类推测解码工作有所区分保持完整因果链顺序预测后续token新增MTP模块和主模型共享embedding层与输出头。训练的时候主损失之外叠加MTP损失加权之后一起回传更新权重。消融实验结果证明即便推理的时候直接把MTP模块完全丢弃只保留原始主模型绝大多数基准测试依然可以看到明显提升。本质上MTP丰富训练信号迫使模型提前对未来文本做表征规划提升数据利用效率。同时训练得到的MTP模块还可以拿来做推测解码实测第二token接受率维持在85%‑90%区间实现约1.8倍解码吞吐提升。一个模块同时服务训练优化和推理加速两个场景这个设计相当巧妙。训练基础设施重构FP8大规模落地把万亿token训练成本打下来再好的模型架构没有配套训练基础设施也只是纸上谈兵。DeepSeek‑V3完整训练消耗278.8万H800 GPU小时如果按照每小时2美元租金来估算整体训练成本大约557.6万美元。要知道这包含预训练上下文扩展后训练全部流程预训练阶段每一万亿token仅仅消耗18万H800 GPU小时。对比行业其他大模型训练开销这个数字具备很强竞争力。低成本不是单纯靠有钱堆集群堆出来而是算法框架硬件三者协同设计换来的。训练集群硬件基础是2048张H800 GPU单机内部依靠NVLink跨机器依靠InfiniBand IB互联。MoE训练最大瓶颈往往不是算力而是跨节点all‑to‑all通信token需要在不同GPU之间来回搬运专家并行EP规模一大通信开销很容易吃掉绝大部分算力收益。为了对抗通信开销团队自研HAI‑LLM训练框架推出DualPipe流水线并行算法。传统流水线并行方案会存在大量流水线气泡GPU等待数据算力闲置。DualPipe采用双向流水线调度微批次同时从流水线两端送入把注意力计算all‑to‑all分发MLP计算all‑to‑all合并这些组件重新编排调度把通信操作和计算操作互相重叠掩盖。它不会追求零气泡但大幅度削减气泡占比付出的代价是需要保存两份模型参数会带来少量内存开销。但是在MoE场景专家并行EP占用大量显存两份参数带来的额外开销被稀释整体收益远大于代价。光有流水线调度还不够还需要专门定制跨节点all‑to‑all通信内核。IB带宽显著低于单机NVLink带宽如果不加约束大量token跨机器传输会直接堵死训练吞吐。V3采用节点限制路由每一个token最多被分发到4个节点。token先通过IB发送到目标节点对应索引GPU再在单机内部经由NVLink转发给对应专家GPU。把高延迟跨机器通信量压到最低大量数据搬运转移到高速NVLink内部完成。通过warp特化技术划分专门通信通道仅仅消耗20个SM单元就可以打满IB和NVLink带宽。内存优化上也做了大量细碎但是关键的工作。对RMSNorm和MLA上投影做重计算反向传播的时候重新计算不用持久保存对应的激活值用少量计算开销换取巨大显存节省。把EMA指数移动平均参数存放在CPU内存异步更新不占用GPU显存。MTP模块和主模型物理共享embedding与输出头进一步减少显存占用。这些工程细节不会出现在模型架构示意图中但却是大规模训练能够跑起来的必要条件。整篇报告里非常值得细读的章节是FP8混合精度训练实现。FP8低精度训练不是新概念但是在此之前几乎没有公开工作能够在600B级别MoE模型完整验证FP8训练的可靠性。FP8拥有比BF16更高算力上限但动态范围有限激活、权重、梯度里的异常值outlier极易带来数值溢出训练发生漂移甚至发散。很多团队尝试FP8训练最后只能小规模实验大模型还是退回BF16保稳定。DeepSeek‑V3没有简单照搬NVIDIA TransformerEngine那套标准FP8实现而是设计细粒度量化策略。对于激活采用1×128的瓦片分组缩放权重使用128×128块级分组缩放不再对整个张量使用单一缩放因子用更小粒度分组去适配张量内部数值剧烈波动抑制异常值带来量化误差。另一个关键改动是改进矩阵乘累加精度。H800的Tensor Core原生FP8矩阵乘中间累加仅仅保留大约14bit有效位当矩阵内维度K很大的时候误差会快速累积。他们采用间隔提升精度的策略每完成Nc128个元素的矩阵乘累加之后把中间结果搬运到CUDA Core切换到FP32寄存器做高精度累加。这样兼顾Tensor Core算力吞吐同时把累加误差控制在安全区间。整套方案全部张量统一使用E4M3格式而不是行业常见E4M3/E5M2混合模式依靠细粒度分组缩放弥补动态范围不足。当然也不是所有算子一股脑全部丢进FP8。embedding层输出头MoE门控归一化注意力模块依然保留BF16或者FP32高精度。主权重梯度优化器主状态维持高精度仅仅GEMM核心计算走FP8。消融实验结果显示对比BF16基线FP8训练相对损失误差始终低于0.25%处在训练随机波动范围内不会损害模型最终效果。同时实现训练速度提升激活缓存通信数据都可以压缩为FP8降低内存与带宽压力。报告末尾还专门给出面向AI芯片厂商硬件设计建议这部分内容很少被读者留意但价值很高。基于他们MoEFP8大规模落地踩坑经验提出几点现实诉求希望未来硬件提供通信卸载协处理器把all‑to‑all通信任务从宝贵的SM单元剥离出去Tensor Core原生支持瓦片、块级细粒度量化支持在线量化融合内存读写运算支持矩阵转置读取加速量化流水线。这是一线大模型训练团队给下一代AI硬件的真实需求反馈。预训练与长上下文后训练对齐从基座到对话模型的完整链路DeepSeek‑V3基座模型在14.8万亿高质量多语种token上面完成预训练。相比V2版本数据集调高数学、代码样本占比扩大中英以外多语言覆盖。采用文档打包技术同时沿用Fill‑in‑Middle填充中间文本FIM策略概率设置0.1也就是10%文档采用PSM格式处理增强模型代码补全能力。tokenizer是128K字节级BPE为了缓解多行prompt的token边界偏差训练时随机拆分一部分合并标点换行的复合token。模型超参数上一共61层Transformer隐藏维度7168。除最前面三层其余全部替换为MoE层。每一个MoE层包含1个共享专家256个路由专家每个token激活8个路由专家加上共享专家推理阶段实际激活37B参数。预训练阶段最大序列长度4096学习率调度batch size调度无辅助损失均衡的bias更新速率MTP损失权重都设置了分阶段变化超参数调优细节全部公开。预训练完成之后分两个阶段完成上下文窗口扩展借助YaRN技术先扩展至32K再进一步扩展到128K每个阶段1000步微调。Needle In A Haystack海针测试结果显示在整个128K上下文区间检索能力表现稳定。这里需要客观看待海针测试它只是长上下文能力其中一项指标只代表检索召回不等同复杂长文本推理但是至少证明窗口扩展没有出现明显崩坏。拿到基座模型之后需要经过SFT监督微调RL强化学习对齐才能得到可以直接使用的对话版本DeepSeek‑V3。这部分工作有一个非常亮眼创新从DeepSeek‑R1长思维链模型做知识蒸馏。R1模型拥有极强推理能力但输出经常过度思考文本冗长格式混乱不适合直接拿来做线上服务。团队没有直接简单拿R1输出做SFT数据而是一套多阶段处理流程。首先针对数学代码竞赛这类推理领域先用基座模型结合SFTRL训练领域专家模型。专家模型再去生成样本之后拒绝采样筛选高质量样例得到兼顾推理正确性和输出简洁度的数据集。既吸收R1反思、验证的思维模式又抑制过度输出问题。非推理领域则使用V2.5生成配合人工校验。整套SFT数据集规模150万样本覆盖多个领域。强化学习环节采用GRPO分组相对策略优化不需要单独critic评论家模型依靠组内样本得分计算优势函数。奖励来源分为两类规则型奖励和模型型奖励。数学代码可以做结果校验的任务优先用规则奖励编译器运行结果数学答案格式校验规避奖励黑客攻击风险。开放生成类任务则使用奖励模型给出打分。同时论文还提到自奖励Self‑Rewarding的实践利用模型自身投票结果作为反馈配合宪法AI完成主观维度对齐。经过整套后训练流程之后对话版本在大量基准上交出亮眼答卷。MATH‑500拿到90.2的高分AIME 2024达到39.2Codeforces百分位51.6在竞赛级数学代码上面拉开和多数开源模型差距。中文事实数据集C‑SimpleQA超过Qwen2.5‑72B体现中文能力优势。开放评测Arena‑Hard达到85.5%胜率AlpacaEval2.0取得70分。甚至在RewardBench上面DeepSeek‑V3直接充当生成式奖励模型评判能力对标GPT‑4o、Claude‑3.5‑Sonnet。但我们不能被漂亮的表格完全迷惑。报告同样坦诚写出短板英文事实基准SimpleQA上DeepSeek‑V3依旧弱于GPT‑4o和Claude‑3.5‑Sonnet。这和预训练数据资源分配有关模型分配更多容量去学习中文知识英文事实性存在提升空间。SWE‑Bench Verified指标42.0显著弱于Claude‑3.5‑Sonnet的50.8工程级软件任务依旧和头部闭源模型存在差距。推理部署的现实枷锁MoE光鲜数据背后的落地代价很多读技术报告的人会把全部注意力放在训练部分忽略部署章节。但对于真正想要落地使用模型的开发者推理部署章节才是决定能不能用好不好用的关键。MoE模型有一个永恒矛盾训练看起来性价比极高推理的硬件门槛却并不低。DeepSeek‑V3把prefill预填充阶段和解码decoding阶段做分离部署两套不同并行策略。预填充最小部署单元4节点合计32张H800注意力部分TP4张量并行加SP序列并行MoE模块EP32专家并行。解码阶段的最小部署单元扩大到40节点320张H800EP320专家并行。看到这个数字就能立刻感受到现实压力。想要跑通完整高性能推理需要几十台机器数百张H800小规模团队几乎不可能复现这套配置。为了解决推理阶段专家负载分布漂移他们引入冗余专家策略。线上服务持续统计各个专家负载定期识别高负载专家做冗余复制部署。prefill阶段配置32个冗余专家每一块GPU除原生8个专家之外额外托管一个冗余专家。解码场景把共享专家视为路由专家每个token一共选择9个专家单GPU只存放一个专家依靠大量GPU横向扩展。团队同时也在探索动态冗余路由方案每一层all‑to‑all之前在线计算全局最优路由进一步优化负载。同时工程上做微批次重叠把一个微批次的注意力计算和另一个微批次的all‑to‑all分发合并操作互相重叠隐藏通信延迟。即便如此报告自己也明确写出模型现存局限。第一最低部署单元规模大给小团队带来沉重硬件负担。第二虽然对比V2版本吞吐翻倍但依然存在进一步优化空间。这恰恰是现在高性能MoE开源模型共同的现实困境。训练阶段每token仅激活37B参数看似计算量不高但专家并行EP需要大量GPU分布式存放海量专家权重。你不可能把全部256个专家塞进单张或者少数几张GPU显存。如果强行在少量GPU运行就必须开启模型分片会带来巨大通信开销吞吐急剧下跌。MoE的低成本优势只有在大规模GPU集群环境下才能兑现。普通开发者想要本地跑V3只能依靠量化压缩而量化之后会不可避免损失数学代码等复杂任务能力。这一点是所有准备上手V3的人需要提前做好心理预期。站在这份报告结尾重新审视开源大模型的前进方向读完整篇DeepSeek‑V3技术报告最大的感受是大模型竞争已经不再是单纯比拼参数量比拼跑分榜单。V3的成功是算法创新训练框架工程低精度实现数据处理后训练对齐推理部署一整条链条综合实力的体现。过去很多人会把MoE简单理解为“大模型省钱秘籍”看完这份文档应该要修正这个认知。MoE不是魔法想要发挥MoE全部潜力背后需要一整套配套的工程体系每一处架构改动都会传导到训练框架通信策略量化方案推理部署的每一个环节。无辅助损失负载均衡MTP多token预测大规模可复现FP8训练从R1长CoT模型蒸馏推理能力这几项是这份报告最主要创新点。同时团队也没有神化自己提出的算法能客观写出各个方案的边界无辅助损失只保证批量维度均衡推理分布漂移交给部署层解决MTP推理可以直接丢弃模块FP8也不是所有算子都无脑套用。这种分层次解决问题的工程思路非常值得学习。当然我们也不能忽略它现存的短板。英文事实能力距离顶级闭源模型还有差距软件工程类任务SWE‑Bench还有不小追赶空间最现实的高昂推理集群门槛限制它普及。未来规划中团队提到继续打磨架构向着无限上下文努力突破Transformer架构迭代训练数据深挖深度思考能力完善评测体系避免过度拟合固定基准。放到整个行业视角来看DeepSeek‑V3证明开源模型可以极大缩小与闭源头部模型差距尤其在数学代码这类高价值技术任务上面。但它同样清晰告诉我们性能追赶不只是写论文刷基准无数看不见的工程细节才是拉开差距的地方。很多算法论文提出亮眼想法却没有万亿token规模实跑验证很容易低估真实环境下各种边界情况。这份技术报告最大价值就是完整公开大规模MoE实践中遇到的各类问题以及他们踩坑之后得到解决方案。对于普通技术人员不一定会立刻动手训练一个671B参数MoE模型但是报告里面很多思路可以迁移到中小规模模型开发。细粒度量化思想多token预测训练目标不依靠辅助损失做MoE负载均衡从强推理模型蒸馏思维链模式计算与通信重叠流水线调度这些思路都可以启发中小型模型迭代。开源大模型的赛道已经走过简单堆参数的蛮荒时代正在进入精细打磨全链路工程实现的新阶段。DeepSeek‑V3不是终点它更像一块路标告诉我们MoE路线究竟可以走到什么高度同时也把未来需要攻克的难题清清楚楚摊在所有人面前。