快科技9月14日消息,据报道,微软Azure硬件系统与基础设施总裁Rani Borkar近日表示,单纯增加存储芯片产能无法解决AI基础设施的瓶颈。她批评道:“存储不应被视为供应或组件问题,本质上是系统问题。”
Borkar指出,AI推理模型越来越大、对话上下文越来越长,存储与电力正成为比计算芯片更难绕开的硬限制。许多AI系统由多层架构组成,受限于数据传输延迟与带宽限制,系统往往仅能发挥约20%的实际性能。
她提出的解决路径是“从芯片到系统”的跨层协同设计,涵盖模型、编译器、芯片、网络到供电的联合优化。目标是在相同存储容量与电力条件下,让更多计算资源持续工作并产出更多token。
以微软自研AI加速器Maia 200为例,Borkar表示微软并非只靠增加存储容量处理瓶颈。Maia 200采用台积电3nm工艺,搭载216GB HBM3e高带宽内存,同时从模型压缩、数据科学与架构设计三方面降低KV Cache需求。
网络方面,微软采用双层Scale-up网络,将网络接口控制器直接整合进芯片,搭配定制化传输层。此举降低延迟的同时减少昂贵加速器因拥塞、故障恢复或配置不当而闲置。
电力端同样面临巨变。AI机柜功耗已从数十千瓦升至数百千瓦,数据中心园区以吉瓦规模规划。微软导入固态变压器与800V直流供电架构,并将精细电压与时钟控制器直接整合至Cobalt 200的每个核心内。
Borkar强调,没有任何一项创新能单独消除瓶颈,但放在一起就能大幅提高相同存储资源所交付的成果。微软提出的“有效产出”新指标,正将AI基建竞争从堆砌芯片数量转向系统级效率比拼。


