DeepSeek V4.1 Pro或为2万亿参数:未来还有8万亿版、押注国产芯片
  • 宪瑞
  • 2026年09月21日 20:34
  • 0

快科技9月21日消息,此前我们分析了中秋国庆双节前后国内外要发的10多款大模型,其中最受期待的还得是DeepSeek V4.1 Pro。

跑得比较快的Theinformation网站又爆料了新的消息,DeepSeek正在训练2万亿参数量的大模型,未来还会扩展到8万亿参数量。

而且DeepSeek的大模型训练未来会押注国产AI芯片,尤其是华为的昇腾系列,不过具体情况就没有细节流出了。

未来的8万亿参数量大模型不好说是哪年推出,但报道中的这个2万亿参数量的大模型很有可能就是快要发布的DeepSeek V4.1 Pro了,就是不知道梁历哪个月发了,节前希望不是很大,10月中旬到下旬可能性更高。

从之前发布DeepSeek V4.1 Flash的信息中可以看出V4.1 Pro会延续全新的架构设计,包括CED+Engram、Prefill与Decode拆分、非对称式激活结构等技术,让AI来估算的话,比较合理的参数如下所示:

DeepSeek V4.1 Pro或为2万亿参数:未来还有8万亿版、押注国产芯片

训练这样2万亿参数量的大模型差不多需要50-60万亿Token,按照目前的显卡算力估算的话,H100/H200这样的卡需要3万张,B200需要1.5万张,910C这样的要6万张,但如果是昇腾950系列,也就是3万张,跟H200差不多。

DeepSeek V4.1 Pro或为2万亿参数:未来还有8万亿版、押注国产芯片

DeepSeek新一代大模型的发展方向也是跟国产AI芯片深度绑定的,华为的昇腾950系列有PR和DT两个系列,适合的工作也是分为训练及推理的,也把Prefill与Decode两个过程拆分了,DeepSeek的新架构显然是跟昇腾走软硬件协同优化AI训练、推理的。

用国产AI芯片训练万亿级别的大模型已经有过报道和实例了,但是2万亿规模的还没有确认的,目前超过2万亿参数量的国产大模型主要有文心一言5.0、Kimi K3、千问Qwen 3.8 Max,没发布的还有MiniMax M3等,都没宣传过是用国产AI芯片训练的。

DeepSeek V4.1 Pro如果用了国产AI芯片进行2万亿参数量的大模型训练,即便不是全部训练过程,那也是里程碑性质的进步。

明年华为的昇腾960系列还会提前1-3个季度上市,困扰国产大模型发展的算力问题未来几年会大幅缓解,那就有机会跟OpenAI、Anthropic正面竞争了。

DeepSeek V4.1 Pro或为2万亿参数:未来还有8万亿版、押注国产芯片

文章纠错

  • 好文点赞
  • 水文反对

此文章为快科技原创文章,快科技网站保留文章图片及文字内容版权,如需转载此文章请注明出处:快科技

观点发布 网站评论、账号管理说明
热门评论
查看全部评论
相关报道

最热文章排行查看排行详情

邮件订阅

评论0 | 点赞0| 分享0 | 收藏0