华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%
  • 红茶
  • 2026年08月12日 20:02
  • 0

快科技8月12日消息,由华为2012实验室、华为云、计算、终端等团队联合打造的开源智能体平台openJiuwen,近日联合昇腾推出了一项名为“算力亲和”的全链路协同技术。

该技术打通了Agent框架、推理引擎与底层算力之间的协同壁垒,通过让KV Cache(键值缓存)从被动管理走向主动协同,使Agent推理的首Token时延降低57%以上,推理存储占用峰值下降25%。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

随着AI Agent应用日益复杂,单个任务可能持续数十分钟甚至数小时,多个Agent还需分工协作。任务越长、协作的Agent越多,推理过程中产生的KV Cache就越庞大,推理时延也越久。

然而,传统推理引擎只能看到请求和缓存,却看不懂Agent正在做什么。如果子任务已经结束,缓存可能还停留在昂贵的NPU显存里;如果会话暂时挂起时,缓存却继续占着最贵的资源位置。

这背后的核心问题是:Agent掌握任务状态,引擎掌握算力资源,两者之间缺一条传递语义的通道。openJiuwen的解法是在Agent与推理引擎之间建立一套“状态契约”,即Agent Hint。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

Agent在关键状态变化时发出Hint信号,告诉引擎当前会话的生命周期状态;引擎据此执行对应的缓存动作:驱逐、卸载、预取。缓存不再只有“留在显存”或“排队等淘汰”两种命运,而是随任务节奏在存储层级间主动流动。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

测试结果显示,开启算力亲和后,模型请求端到端时延降低27.61%,前缀缓存命中率提升33%,池化缓存使用量峰值降低25.24%。

当前这套能力即将开源,感兴趣的开发者可以关注openJiuwen开源社区。

华为昇腾出手了!智能体推理慢的根因终于被找到:首Token时延砍半、存储省25%

文章纠错

  • 好文点赞
  • 水文反对

此文章为快科技原创文章,快科技网站保留文章图片及文字内容版权,如需转载此文章请注明出处:快科技

观点发布 网站评论、账号管理说明
热门评论
查看全部评论
相关报道

最热文章排行查看排行详情

邮件订阅

评论0 | 点赞0| 分享0 | 收藏0