快科技9月1日消息,腾讯混元发布Hy4 preview轻量量化版本并开源,原版BF16权重体积高达1.5TB,社区反馈本地部署硬件门槛过高,腾讯混元团队借助自研压缩技术,将模型压缩至约214GB,大幅降低运行硬件要求。
压缩依靠两项核心自研技术,Sherry稀疏三值量化算法与MIX-STQ1_0混合精度策略。
Sherry稀疏三值量化,将每4个权重分为一组,量化为{-1、0、+1},每组固定一个零值,平均每个权重仅1.25比特,计入额外开销实际约1.31bpw,并且在llama.cpp完成STQ1_0推理内核实现,推理速度对标IQ1_M,优于IQ1_S。
MIX-STQ1_0混合精度策略,不再全部层统一比特,而是依据校准数据判断各层敏感度,敏感层采用IQ2_XXS,不敏感层使用激进的STQ1_0,在不提升平均比特开销前提下降低量化误差,相比UD-IQ1_M方案还可以节省5GB以上存储空间。
性能评测显示,压缩后的模型相比原版,长文理解、长上下文检索能力基本持平,数学能力仅有小幅回落,编码、工具调用、文档处理、常规问答能力都得到保留,整体表现优于UD-IQ1_M量化版本。
此外还验证了异构设备联合推理方案,借助prima.cpp调度能力,将一台4090笔记本与四卡A4000服务器跨局域网协同,显存内存合计144GB,成功跑通214GB模型,推理速度达到1.02 token/s,比笔记本单机offload快6倍。
这证明不必采购整套同构高端硬件,利用手头多台异构设备拼接,也可以运行该模型。

目前量化GGUF权重、基础模型、AngelSlim代码仓库已经在HuggingFace与GitHub开源,开发者可自行下载部署。





