耀章 耀章-选择力

一直到去年底,如果有人问我国产大模型跟大佬们的差距,我的预测一直很悲观,主要因为三点难以解决:成本、芯片、语料。 成本是因为国产大模型的大玩家基本还是商业驱动,没法保障在不盈利的情况下持续投入;芯片卡脖子大家都懂;语料质量不如英文,内容限制也更多。然而理想主义挂帅的DeepSeek 凭一己之力把这些限制一一打破了。

首先DeepSeek 最吸引眼球的就是在保障效果的前提下成本极低, 降低成本的努力从方方面面都能体现。

模型结构MLA+DeepSeek-MoE

1. 高效 MoE 结构:DeepSeek采用混合专家(MoE)架构,通过MoE 和无辅助损失负载均衡策略,解决了 MoE 模型的专家负载不均问题。采用细粒度专家,并动态调整路由,确保计算效率和训练稳定性,同时提升多 GPU 扩展能力。

2. Multi-Head Latent Attention(MLA)通过将键和值压缩到低秩潜在空间,显著降低了内存使用和计算成本。这使得模型能够高效处理长序列数据,如整本书或高分辨率图像,同时保持较低的计算开销。 

3. MTP(Multi-Token Prediction)旨在提升模型的训练和推理效率。在训练阶段,MTP 使训练信号更加密集,提高了数据利用效率。在推理阶段,MTP 允许模型同时生成多个令牌,显著加快了文本生成速度。这种方法不仅提高了模型的性能,还降低了计算开销。 

训练框架

4. 设计了 DualPipe 算法以实现高效的流水线并行。与现有 PP 方法相比,DualPipe 具有更少的 PP Bubble。更重要的是,它在 Forward 和 Backward 过程中 Overlap 了计算与通信,从而解决了跨节点 EP 引入的高通信开销问题。

5. 开发了高效的跨节点 All2All 通信 Kernel,以充分利用 IB 和 NVLink 带宽,并节省专用于通信的 SM。

6. 精心优化了训练过程中的内存开销,从而能够在无需使用昂贵的 TP(Tensor Parallelism)的情况下训练 DeepSeek-V3。

7. FP8 混合精度训练框架,大多数计算密集型操作以 FP8 执行,而少数关键操作则保留其原始数据格式,以平衡训练效率与数值稳定性。

Image
Image
DeepSeek R1 关键技术突破 
8. 强化学习驱动的推理能力提升 
 • 纯RL探索:DeepSeek-R1-Zero完全摒弃监督微调(SFT),采用纯强化学习(RL)训练,探索 LLM 在无监督环境下的推理极限。 
 • GRPO算法:引入 Group Relative Policy Optimization(GRPO)算法,避免传统 RL 训练中的 Critic 依赖,简化流程并降低计算成本。 
 • 推理导向强化学习:DeepSeek R1 结合监督微调(CoT数据)与RL训练,强化数学、代码和科学推理能力,并通过语言一致性奖励提高输出质量。 
9. 模型蒸馏与高效部署 
 • 高效知识传承:通过蒸馏技术,将 DeepSeek R1 的推理能力迁移到更小规模的模型,使轻量化模型在推理任务中的表现超越部分大模型。 
 • 低硬件门槛:DeepSeek-R1-32B 可在 24GB 显存运行,DeepSeek-R1-8B 适配 8GB 显存,并支持 4-bit 量化,降低部署成本。 
Image
GPU 优化突破
10. V3模型采用的GPU优化方案,通过直接操作NVIDIA GPU的PTX语言,实现了超越CUDA的性能提升。 这种优化方式使得在H800 GPU上的计算效率得到显著提升,其中包括创新性地划分20个SM用于服务器间通信,以及实现了高效的流水线算法。数据显示,通过PTX级别的优化,模型训练性能相比传统CUDA方案提升了超过30%。
这个第十条在大年初一被热议一整天,其实也是早就在V3 的论文里有过清楚的解说了,日前已经证实deepseek 已经支持并适配了华为升腾芯片和AMD 的Instinct MI300X。
小结
以上十条,可以看出来DeepSeek整体思路是在节约训练成本和解决芯片性能方面下了大功夫,而DeepSeek R1 通过引入强化学习(RL)机制,显著减少了对人工标注数据的依赖。其子模型 DeepSeek-R1-Zero 完全摒弃了监督微调(SFT),仅通过纯强化学习训练,证明了在无监督环境下模型自主发展推理能力的可能性。  这种方法有效缓解了训练语料有限的问题,使模型能够在缺乏大规模标注数据的情况下,仍具备强大的推理能力。
至此,我担心的成本,芯片,语料三点限制,都被DeepSeek的发展路线完美覆盖,并都在推进进程中了!
关于未来趋势的一些思考

1. 英伟达不行了吗? 

个人认为短期确实利空消息偏多,但长期利好整体芯片行业。几大限制的解除,可以说把过去两年大家认为的基座模型只有头部玩家才可以下场的范式打破了,可以预见未来下场的中型玩家会极速增长,对各类芯片的需求反而会进一步提升,所以不光是英伟达,未来几年芯片的销售和业绩仍然看好。很大可能打破了英伟达的垄断地区,反而会让芯片业更蓬勃发展。百花齐放才是春。

2. 大模型普惠

个人认为DeepSeek 做出的突出贡献是降低了大模型的开发和使用成本,让更多人更多组织可以投身进这个热火朝天的战场。AGI的发展会加速,模型的更新速度会越来越快,以天记。

3. 我心目中的终极模型是怎样的

DeepSeek 一系列降低成本的简化流程的操作,从侧面证明我们一直跟随的由OpenAI 创造的一整套复杂流程,可能存在大量冗余。未来我希望看到模型更简单更强大更优雅,用霍金描述的优秀模型的定义来说明我想象中的完美模型

Image

我们的模型,参数还是太多,过程还是太像炼丹,还属于知其然不知其所以然的阶段。 正如物理界一直在探索简洁优雅的统一宇宙模型一样,希望AGI 的范式也能往这个方向探索。所以除了工程师们继续努力以外,数学家们也请努力💪