腾讯混元发布Hy4 preview轻量版 模型体积大幅压缩并支持异构设备协同推理
来源:互联网腾讯混元于9月1日推出Hy4 preview轻量版,将模型权重从接近1.5TB压缩至约214GB。这一变化依托两项核心技术:自研Sherry稀疏三值量化算法,将最激进一档权重压至平均1.25比特;MIX-STQ1_0混合精度策略,按敏感度逐层决定每层比特数,在同等平均比特预算下降低量化误差。

从接近1.5TB到约214GB,权重规模的下降意味着模型对存储空间和加载环境的要求显著降低。Sherry稀疏三值量化算法在权重压缩上采用了三值表示与稀疏化结合的方式,平均1.25比特的权重占用处于极低比特区间。MIX-STQ1_0混合精度策略则按层敏感度分配不同比特数,避免统一低比特带来的精度损失,从而在同等平均比特预算下控制量化误差。
压缩后的模型在主流评测任务上能力保持稳定,长文理解、多轮长上下文检索与原始版本基本持平。评测结果覆盖了长文理解与多轮长上下文检索两类任务,显示轻量版在压缩后仍能维持与原始版本相近的表现。
异构设备联合推理
腾讯混元同时验证了异构设备联合推理方案。在一台4090笔记本与一台四卡A4000服务器上,显存合计80GB、内存64GB,通过调度将MoE层拆开分配,协同运行速度达1.02 token/s,较笔记本单机offload提升约6倍。
该方案将MoE层拆开分配至不同设备,利用笔记本与服务器合计80GB显存和64GB内存完成协同推理。1.02 token/s的协同运行速度相比笔记本单机offload提升约6倍,表明异构设备之间的调度能够分担单机负载,提高推理效率。
量化GGUF库及相关代码已同步开源。腾讯方面表示,该方案为资源有限或手边已有异构设备的开发者提供了运行旗舰大模型的新路径。开源内容包括量化GGUF库及相关代码,开发者可直接获取用于模型量化与部署。