Original 耀章-选择力
一直到去年底,如果有人问我国产大模型跟大佬们的差距,我的预测一直很悲观,主要因为三点难以解决:成本、芯片、语料。 成本是因为国产大模型的大玩家基本还是商业驱动,没法保障在不盈利的情况下持续投入;芯片卡脖子大家都懂;语料质量不如英文,内容限制也更多。然而理想主义挂帅的DeepSeek 凭一己之力把这些限制一一打破了。
首先DeepSeek 最吸引眼球的就是在保障效果的前提下成本极低, 降低成本的努力从方方面面都能体现。
模型结构MLA+DeepSeek-MoE
1. 高效 MoE 结构:DeepSeek采用混合专家(MoE)架构,通过MoE 和无辅助损失负载均衡策略,解决了 MoE 模型的专家负载不均问题。采用细粒度专家,并动态调整路由,确保计算效率和训练稳定性,同时提升多 GPU 扩展能力。
2. Multi-Head Latent Attention(MLA)通过将键和值压缩到低秩潜在空间,显著降低了内存使用和计算成本。这使得模型能够高效处理长序列数据,如整本书或高分辨率图像,同时保持较低的计算开销。
3. MTP(Multi-Token Prediction)旨在提升模型的训练和推理效率。在训练阶段,MTP 使训练信号更加密集,提高了数据利用效率。在推理阶段,MTP 允许模型同时生成多个令牌,显著加快了文本生成速度。这种方法不仅提高了模型的性能,还降低了计算开销。
训练框架
4. 设计了 DualPipe 算法以实现高效的流水线并行。与现有 PP 方法相比,DualPipe 具有更少的 PP Bubble。更重要的是,它在 Forward 和 Backward 过程中 Overlap 了计算与通信,从而解决了跨节点 EP 引入的高通信开销问题。
5. 开发了高效的跨节点 All2All 通信 Kernel,以充分利用 IB 和 NVLink 带宽,并节省专用于通信的 SM。
6. 精心优化了训练过程中的内存开销,从而能够在无需使用昂贵的 TP(Tensor Parallelism)的情况下训练 DeepSeek-V3。
7. FP8 混合精度训练框架,大多数计算密集型操作以 FP8 执行,而少数关键操作则保留其原始数据格式,以平衡训练效率与数值稳定性。
1. 英伟达不行了吗?
个人认为短期确实利空消息偏多,但长期利好整体芯片行业。几大限制的解除,可以说把过去两年大家认为的基座模型只有头部玩家才可以下场的范式打破了,可以预见未来下场的中型玩家会极速增长,对各类芯片的需求反而会进一步提升,所以不光是英伟达,未来几年芯片的销售和业绩仍然看好。很大可能打破了英伟达的垄断地区,反而会让芯片业更蓬勃发展。百花齐放才是春。
2. 大模型普惠
个人认为DeepSeek 做出的突出贡献是降低了大模型的开发和使用成本,让更多人更多组织可以投身进这个热火朝天的战场。AGI的发展会加速,模型的更新速度会越来越快,以天记。
3. 我心目中的终极模型是怎样的
DeepSeek 一系列降低成本的简化流程的操作,从侧面证明我们一直跟随的由OpenAI 创造的一整套复杂流程,可能存在大量冗余。未来我希望看到模型更简单更强大更优雅,用霍金描述的优秀模型的定义来说明我想象中的完美模型
我们的模型,参数还是太多,过程还是太像炼丹,还属于知其然不知其所以然的阶段。 正如物理界一直在探索简洁优雅的统一宇宙模型一样,希望AGI 的范式也能往这个方向探索。所以除了工程师们继续努力以外,数学家们也请努力💪