国产芯片神速!寒武纪Day 0适配DeepSeek V4.1 Flash:模型发布当天就能跑
  • 红茶
  • 2026年09月10日 15:33
  • 0

快科技9月10日消息,寒武纪今日宣布已基于vLLM推理框架完成对DeepSeek最新开源模型V4.1 Flash的Day 0适配。这意味着DeepSeek V4.1 Flash发布当天即可在寒武纪芯片上稳定运行。

DeepSeek V4.1 Flash是DeepSeek全新模型结构系列中尺寸最小的一款,总参数552B的MoE模型。该模型采用全新的Causal-Encoder-Decoder结构,输入侧激活仅8B参数,输出侧激活16B参数,原生具备多模态视觉理解能力。官方称其成本显著低于已知同尺寸模型。

值得关注的是,V4.1 Flash在KV缓存压缩上实现了重大突破。新模型对HBM的需求降至上一代的1/4,对SSD的需求降至1/8。相对初代模型,KV缓存已缩小437倍。

在性能优化上,寒武纪利用自研高性能融合算子库Torch-MLU-Ops对Engram、Compressor等模型结构进行专项加速,并利用BangC高性能编程语言编写稀疏/压缩Attention等热点算子的优化Kernel。

在推理框架优化层面,寒武纪在vLLM中全面支持TP/PP/SP/DP/EP 5D混合并行、通信计算并行、低精度量化以及PD分离部署等优化技术,显著提升端到端推理效率。

寒武纪此次快速适配的背后,是NeuWare软件生态的长期积累。就在两天前的9月8日,寒武纪正式加入PyTorch基金会,成为最高级别的白金成员,将在基金会管理委员会拥有一个席位。与Meta、AMD、AWS、Google Cloud、Microsoft和NVIDIA等全球巨头处于同一级别。

截至目前,寒武纪已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产主流大模型的推理适配,分别对应智谱、深度求索、阿里、月之暗面、MiniMax五家模型厂商。

 国产芯片神速!寒武纪Day 0适配DeepSeek V4.1 Flash:模型发布当天就能跑

文章纠错

  • 好文点赞
  • 水文反对

此文章为快科技原创文章,快科技网站保留文章图片及文字内容版权,如需转载此文章请注明出处:快科技

观点发布 网站评论、账号管理说明
热门评论
查看全部评论
相关报道

最热文章排行查看排行详情

邮件订阅

评论0 | 点赞0| 分享0 | 收藏0