DeepSeek们狂造芯片 英伟达终于不香了?
  • 世超
  • 2026年09月02日 00:08
  • 0

不是哥们,DeepSeek要自己搞芯片???

事情是这样,前段时间,路透社报道说浓眉大眼的DeepSeek已经悄摸做了一年的AI芯片了,正在接触芯片设计、晶圆代工和存储厂商。

但这消息出来没几天,OpenAI就把自己和博通搞的Jalape?o芯片集群端了出来。完事儿同样也在这段时间,Anthropic也说要开始组建自己的芯片团队了。。。

DeepSeek们狂造芯片 英伟达终于不香了?

不是你们一个个的,一边疯狂买英伟达产能,一边又公开表示也要下场搞芯片。难道老黄卖给他们的GPU不香了吗?

经过一番研究我发现,还真是不香了。。。

而这一切都是因为:推理芯片。

DeepSeek们狂造芯片 英伟达终于不香了?

这个所谓的推理芯片,其实也不是啥新词。很多年前谷歌第一代TPU就在研究推理了,前几年各种研究推理芯片的初创公司也不少,像什么Groq、Cerebras、SambaNova,这些可以说是各有绝活。

但是之所以大家现在感到陌生,原因也是显而易见:这个行业在前几年一直都是不温不火,属于大厂们鸟都不鸟的领域。

那么问题来了,前几年大厂对此不甚上心,今年偏说婉婉类卿,为啥突然间大伙都夏侯惇坐飞机,高看一眼了呢?

因为划不来啊。。。这事在当年还没谱。

众所周知,大模型是个发展很快的行业,今天爆火的模型、技术方向,可能过两个月就无人问津了。今年的OpenCLaw小龙虾现在在哪发财咱都不知道,更别说前两年的大模型厂商了。

毕竟那时候旗帜鲜明反对LLM的都大有人在(你小杨哥YannLecun)。。。大模型能走多远都不好说,所以模型厂商们更不可能专门为推理造芯片了。

DeepSeek们狂造芯片 英伟达终于不香了?

毕竟英伟达的卡又不是不能用,训练起来也嘎嘎好使,花时间研究推理芯片那不是闲的嘛。唯一搞推理的谷歌TPU,最开始也不是为大模型准备的,因为那时候大模型都还没出生呢。

但事情的转机,发生在两年前的这个时候。

2024 年 8 月,Google DeepMind 团队发表了一篇里程碑式论文,他们发现只要延长思考时间,模型的正确率就会直接暴涨。

9月开始,OpenAI 的o 系列就开始让原子弹爆炸了;翻过年,DeepSeek-R1 等深度思考模型又给了世界一顿中国震撼。

然后从去年到今年,大家逐渐认识到,AI Agent、多 Agent 协作集群、几十万字的超长上下文分析,已经成了大模型落地工作的标配。深度推理和 Agent 这套技术路线,基本得到了整个行业的确认。

随着技术路线的确认和发展,压力最大的除了前端兄弟,还有 GPU。。。。

DeepSeek们狂造芯片 英伟达终于不香了?

随便打开一个AI对话框,我们在这里输入文字,AI就会返回文字,这看起来非常自然丝滑。

但从AI的视角看,你告诉AI“扮演一个猫娘”,它需要先理解“这句话到底说了个啥?”这一步就被称为Prefill。而AI读懂以后,开始学猫娘说话输出给你的过程,叫Decode。

在Prefill阶段,AI要把一整句话拆成一个个token,然后分别理解这些tokens的含义,这个过程和AI的训练阶段非常相似。

模型怎么才能判断这些token的含义呢,这就涉及到了矩阵。

而纵观天下硬件,最适合算矩阵的算中之霸,就是GPU。

DeepSeek们狂造芯片 英伟达终于不香了?

然鹅,对GPU来说,发送问题的Prefill阶段,和输出回答的Decode阶段,计算过程却完全不同。。。

在Prefill阶段,我们一次性提供了数据,GPU可以自己切分、所有核心一起并行计算,这就很舒服。

用下面图片中的简化公式感受一下:假设我们输入的token需要一个4096参数的矩阵,那么计算出来每从内存搬运 1 个字节的数据,GPU 就可以用这笔数据,执行上千次运算。

但一进入 Decode 阶段,形势就出了问题。

众所周知,现在的大模型都是自回归的,说白了就是要知道上一个词才能算出来下一个词。所以原本Prefill阶段4096行的输入矩阵,到了Decode阶段,会暴跌成只有1行。

经过同样的计算,每搬运 1 个字节的数据,GPU就只能算一次。。。

DeepSeek们狂造芯片 英伟达终于不香了?

这下就坏菜了。。。

在芯片内部,两个数据相乘的能量消耗非常少。但要把一个数据从显存搬到GPU里,消耗的能量和时间往往是前者的几十倍甚至上百倍。

所以要把一颗芯片的算力拉满,理想的情况一定是,搬一次数据进核心,然后在本地反复算上几万次。最忌讳的就是搬一次算一次,下次要用再临时去搬。

所以在Decode阶段,一个 70B参数140GB 权重的大模型,每向用户输出一个 Token,芯片就必须把这 140GB 从 HBM 显存里完整读入一遍,再吐一个字又重读一遍。

哪怕用上 3 TB/s带宽的顶级显存,输出速度也只有每秒21个token。。。

DeepSeek们狂造芯片 英伟达终于不香了?

换句话说,老子花这么多钱买显卡,结果芯片有 80% 的时间在发呆等数据传过来,这nm谁受得了。

更要命的是,除了推理时间变长,为了记住前面几十万字的思考过程,模型必须把所有历史 Token 的特征全部缓存在显存里,每多思考一步,显存里要搬运的数据量(KV Cache)也跟着爆炸。(这就是为啥显存和内存都纷纷涨价)

过去显存还算够用的时候,各大厂商还能靠纯软件手段来轻松绷住。

比如搞连续批处理,把几十个用户的请求攒起来摊薄搬运成本;还有梁圣的潜在多头注意力机制,压缩 KV Cache来减少GPU的搬运量。

但这些都治标不治本。。。GPU 在本质上是通用芯片而不是推理芯片,它就不是给来Decode的啊!

DeepSeek们狂造芯片 英伟达终于不香了?

实际上,谷歌在很多年前就发现了这个问题。他们当时想到的办法非常简单粗暴,既然通用 GPU 这么拉,那我为什么不专门造一颗只为推理的芯片?

于是,第一代 TPU就诞生了。它用来解决数据搬运问题的核心技术,叫作脉动阵列(Systolic Array)。

把芯片内部比作一个工厂,HBM显存是厂外的中央仓库,SRAM是流水线旁的小筐,计算核心就是打螺丝工位。普通的 GPU 算矩阵,就像一个工人每拧一颗螺丝,就要回显存仓库里拿一个零件,拧完再送回仓库。 

而谷歌的脉动阵列,就是把打螺丝的过程变成了流水线,而且是个二维的流水线。

DeepSeek们狂造芯片 英伟达终于不香了?

他们把上万个乘法计算单元(PE)焊成一个方阵,矩阵的权重数据一旦进了流水线,就像接力棒一样在工位之间横向传递计算,算出来的结果再依次传到下一层计算。

由于数据在相邻的核心之间直接传递,数据每进一次核心,就会在里面连续传递、复用几十上百次,根本不需要退回外部显存,压根就不需要中途再去搬运数据。

所以TPU的这波杀招也成了谷歌能摆脱英伟达卡脖子,在Gemini2.5时代一秒就能脉动回来的关键之一。(当然现在Gemini又拉了)

DeepSeek们狂造芯片 英伟达终于不香了?

以前技术路线没定,TPU这种专用方案在大模型上没显出太大优势,大家也就继续买GPU。

而当现在深度推理让推理负载暴增,TPU的思路开始真正香了起来,包括谷歌都开始把TPU专门分出来训练版和推理版。

于是各大模型厂在这段时间都纷纷觉醒:是时候砸钱做专用的推理芯片了。

当然,吃够了英伟达卡脖子窒息play的大模型厂们,这一次没人愿意再当被动的买家。。。

比起每年把几十上百亿美元ATM给老黄,你还得看人家脸色,有这钱养一个芯片团队开销简直就洒洒水。

DeepSeek们狂造芯片 英伟达终于不香了?

不过真要自己做了,大家也没有只按谷歌的 TPU 的路线去抄。毕竟模型都是自家的,怎么也得自己调教开发才能找到最适合的硬件啊!

拿 Anthropic 来说,脉动阵列虽然快,但大量的杂活就不能脉动回来了。所以 Anthropic不仅搞脉动流水线,还选择跟AWS深度合作了Trainium(另一方面A社自己也宣布要自研),拿着 Claude 模型运行的真实工序数据,反向写进底层编译器。

而投奔了英伟达的Groq,他们的思路就是极端流水线派,认为普通芯片把显存的数据搬来搬去完全是浪费。所以直接把HBM 显存给砍了,然后把整颗芯片塞满SRAM,相当于所有货都放在流水线旁边的小筐,随用随取。

相比极端派,国内的阿里就正好反过来。如果底层架构写死,到时候大模型架构变了咋办?所以他们选择拼一刀,让大量灵活通用的标准加工岛,一起拼同一套缓存SRAM。

DeepSeek们狂造芯片 英伟达终于不香了?

至于OpenAI嘛,如果说前面几家都还在生产线上下功夫,他们相当于把整个工业园区重建了一遍。OpenAI的Jalapeno推理集群跟博通合作,把芯片、HBM、本地缓存、芯片间网络一起设计,靠让特定用户的 KV Cache 记忆档案和特定的算力集群绑定来减少搬运。

于是这么看下来,模型厂和硬件厂之间就形成了一个类似汽车行业的格局,比方谷歌就像比亚迪,从TPU 到 Gemini 全栈自研;OpenAI + 博通就类似吉利,放出图纸和需求来让能力最强的制造商落地;

而Anthropic + 亚马逊 AWS就有点像鸿蒙智行。

当然英伟达、Groq就还是那个卖铲子的人。无论上层算法风向怎么变,买老黄这套东西永远是最稳妥的选择。

DeepSeek们狂造芯片 英伟达终于不香了?

最后再说说DeepSeek。

由于咱们目前能查到的信息只有DeepSeek说要搞推理芯片,但具体怎么个搞法,目前还没有信息出来。

不过,2025年梁圣写过一篇文章,点名下一代AI硬件最需要解决的问题就包括低精度计算、内存容量、计算效率、芯片间互联和低延迟通信。再加上DeepSeek模型的特点,咱们也可以脑补一下。

设计上大概率也是根据模型适配来设计芯片,但因为DeepSeek本身对KV Cache压缩,以及MoE的相关技术,可能会有更大的内存容量但优化算力,或者专门对通信路由做优化,比如降低数据精度来进一步压缩,留出专用数据通路等等。

当然最终还是以DeepSeek自己的技术论文为准,咱就不多bb了。

DeepSeek们狂造芯片 英伟达终于不香了?

讲到最后,其实大伙可能会发现,AI厂商其实在这一波过程中和英伟达的关系似乎出现了一些微♂妙的变化。

以前大家都是让AI模型适应芯片,拿到什么卡,就研究怎么切分模型、压缩KV Cache、调教通信,恨不能直接变成H200的形状。

但现在,不是所有环节都必须要GPU了。以后不再是GPU厂商制约AI厂商,而是AI厂商可以主动选择适合自己的软硬件,以及上下游配套。

这样一来,模型公司就不用看硬件厂商的脸色适配了,翻身把歌唱属于是。

那么可想而知,以后在这条时间线上很有可能发生如下画面:

模型公司终于可以对芯片团队说,我的模型很大,你忍一下。


文章出处:差评

文章纠错

  • 好文点赞
  • 水文反对
观点发布 网站评论、账号管理说明
热门评论
查看全部评论
相关报道

最热文章排行查看排行详情

邮件订阅

评论0 | 点赞0| 分享0 | 收藏0