核心信息

腾讯 Hy4-preview(770B MoE,每层 256 个路由专家)通过 MIX-STQ1_0 混合精度量化方案,从 1.5TB 压缩至约 200GiB GGUF。该方法不是统一使用低比特,而是由校准数据逐层分配位宽,相对 BF16 精度几乎不变。

要点

  • MIX-STQ1_0 把位宽当作分配问题:校准数据决定每层精度,29 层使用 1.3125 bpw STQ1_0(三值 {-d, 0, +d},强制 3:4 稀疏),其余层使用 2.06 bpw IQ2_XXS。
  • 下投影(down experts)直接写入残差流,因此分配更高精度;模型大部分参数集中在路由 gate/up 投影。
  • 相对 BF16 精度几乎不变:MCP Atlas 83.7→83.2,SWE-Bench multi 82.9→81.3,MRCR 81.3→81.1,IFBench 73.5→72.5。
  • 权重和低比特 GGUF 已发布在 Hugging Face:AngelSlim/Hy4-preview-GGUF。