今年以来,“Token成本”成了AI行业的热词。一个AI悖论渐渐浮出水面:虽然模型单价已经降到每百万Token几毛钱的“白菜价”,但各类Agent Token消耗却涨了上百倍,“AI账单”不减反增、总成本越来越高。
要如何降低Token成本?背后事关一条Token生产链——从GPU芯片,到操作系统,AI框架,推理引擎,再到云计算集群,最后生成Token。
今年的世界人工智能大会上,沐曦股份将这条Token生产链“搬”到了线下——龙蜥社区、PyTorch基金会、vLLM、SGLang、CNCF、密瓜智能(HAMi)、RedHat、九源联合体、木兰开源社区、模力方舟——十大“顶流”开源社区首次聚集在沐曦“开源工坊”展台。
每个Token背后都是一条开源协作链
一家芯片公司的展台,为什么要请来操作系统、AI框架、推理引擎、云原生调度的“半个开源圈”?答案就藏在展台的Slogan里——每个Token背后,都是一次开源协作。
每一个Token从生产到消耗,都要穿过一条开源协作链:
最底层是算力层:算力是生产Token的“发电厂”,提供AI计算的原始动力。沐曦股份凭借自研GPU与配套软件平台MXMACA,为Token生产持续提供高能效、高通用性的算力。
向上一层是操作系统层:操作系统是厂房里的“输电管道网”。任务怎么排队、数据何时从内存送进显存,如何保证GPU、CPU“等待空转”,都由它调度。龙蜥社区致力于打造“AI x OS×云”深度融合的AI原生操作系统,确保“每一分算力都花在刀刃上”。
再上一层是PyTorch所在的框架层:PyTorch是全球AI模型“通用图纸”,从训练到推理,AI链条上下游都以它为共同语言,有了公共标准,开发者换硬件不必重写代码,省下的正是最贵的隐性迁移成本。
VLLM、SGLang所在的推理引擎层是目前Token降本最受关注的一环:推理引擎,决定了“一堆任务请求怎么被高效地算”。vLLM用PagedAttention技术把显存像内存分页一样精细管理、碎片率降至接近零。SGLang用RadixAttention让多轮对话不再重复计算历史上下文,大幅压缩多轮对话消耗Token量。从结果看,推理引擎决定了一块GPU能同时服务多少用户、每个Token的成本压到多低……被认为是离AI账单最近的一层。
调度与基础设施层:CNCF、密瓜智能HAMi、RedHat都位于这一层。单机再快,千卡集群管不好照样烧钱,这一层是全厂“总指挥”。CNCF制定云原生调度的交通规则,HAMi让异构算力切分共享、混编调度,RedHat保证AI负载在任何云、任何芯片上稳定运行。
最上一层是开源治理层:九源联合体、木兰开源社区、模力方舟集中于这一层。如果说之前的五层解决“造得出”,这一层解决“用得开”。九源为多家国产芯片制定统一计算架构,让软件不必逐款适配;木兰以国家级中立托管和首个中文开源协议族,为开源协作提供治理保障;模力方舟则把主流模型与国产算力打包成开箱即用的在线服务——将链条上所有降本成果,最终在这里变成开发者触手可及的Token。
在这条链上,Token从生产到消费,每一个Token是否被充分利用,最终体现在每一次生成答案的质量上。模型精度、推理延迟、显存效率、集群吞吐,AIInfra链路上的许多指标都会影响Token的生产效率,进而决定Token的成本。
如此的复杂度也决定了没有任何一家公司能同时把GPU硬件、操作系统、AI框架、推理引擎、云原生调度全部做到极致。
十家社区聚在沐曦展台上说明:Token降本不是某一层的独角戏,得靠整条链深度协作,而开源是实现跨层协作不可或缺的桥梁。“开源,就是要让每一层都有人卷,每个参与方都能共赢。”沐曦股份开源生态相关负责人接受采访时坦言。
为什么是沐曦?
在这条开源协作链上,Token成本不由某一层决定,而需要整条链的跨层协作。而之所以能由沐曦来串联起,根源在于算力层在链上处于“向下对接硬件、向上贯通全栈”的枢纽位置。
国际权威IT咨询机构Gartner在《AI基础设施技术成熟度曲线》中明确指出,在底层大模型与上层应用爆发式增长的背景下,计算硬件及其配套软件栈直接承载了超过70%的AI运营与部署成本。
知名开源社区HuggingFace与业内多项AIBenchmark测试数据也表明,底层GPU算力的显存带宽利用率、计算卡间互联吞吐以及算子软硬匹配度,直接决定了上层推理引擎能否真正释放出PagedAttention或RadixAttention的极致降本效能。可以说,算力不仅是Token生产的“发电厂”,更是所有软硬件调优与算法落地的物理承载者,任何一层开源软件的优化,最终都要收敛并沉淀到GPU芯片的计算吞吐上。
正是这种属性,决定了芯片厂商天然处于“向下对接硬件、向上贯通全栈”的生态枢纽位置。算力行业的竞争,也已经从单纯的硬件算力峰值竞争,演变为“硬件+软件栈+开源社区”三位一体的生态竞争。
用开源,造一个AI时代的“Android”
一直以来,国产算力行业一直面临“重硬件、轻生态”的现实:一方面,国产算力厂商近年来迅速崛起,国内市场份额直追英伟达等国际厂商。另一方面,国产算力生态极度分散,各家厂商软件栈协议标准不统一、兼容性不足。
沐曦一直将开源看作构建自主生态的“必选项”。沐曦股份联合创始人、CTO彭莉用“汽车”来打比方:芯片是引擎,软件栈是传动,开源社区是润滑油。引擎再强,传动不畅车就跑不起来;润滑不足,开发者也不愿使用。
正是基于这样的判断,沐曦选择把最核心的软件栈开源。2025年2月,沐曦宣布将MXMACA软件栈开源。到今天为止,MXMACA软件栈注册开发者用户已超50万人。
同时在兼容性上,MXMACA给出了一条“开放兼容”路径:不仅能原生兼容英伟达CUDA生态,仅修改少量代码就可实现灵活迁移,还已兼容适配40多种AI框架,覆盖训练、推理、科学计算全场景,支持500+AI模型、4500+开源项目运行,覆盖95%以上的主流AI场景,并实现了对PyTorch2410个算子全量覆盖。
按照沐曦的构想,公司将围绕MXMACA软件栈,努力打造一个开放、自主、全栈兼容的智能计算生态,目标是建设成人工智能时代的“Android”。
从一颗芯片,到一条链路,再到一个生态,沐曦要做的从不只是把Token生产出来,而是让每一个Token都被用到极致。在这条Token链上,降本的答案已经写下:不在某一层的极致,而在整条生态链的共荣。

