核心信息
腾讯混元 Hy4-preview 从发布首日起即可在 vLLM 中运行,并已在 NVIDIA GPU 上验证;其稀疏 MoE 与稀疏注意力设计旨在降低推理开销。
要点
- 架构:总参数量 770B、激活参数 49B,256 个路由专家加 1 个共享专家;支持 1M 上下文,但每次查询只需关注 2048 个 token。
- 稀疏索引复用:78 层中只有 21 层自行计算稀疏索引,其余 57 层复用同一索引,减少计算量。
- 内置 MTP:检查点内置 10B 多 token 预测层(激活 0.7B,草稿深度 3)。
- 部署:腾讯的 HPC-Ops attention 与 MoE 内核自 Hy3 起已合入 vLLM 主线;可通过 VLLM_ENABLE_HPC_OPS=1 vllm serve tencent/Hy4-preview-FP8... 启动服务。