核心信息
腾讯混元Hy4-preview从发布首日起即可在vLLM中运行,并已在NVIDIA GPU上验证。该模型采用770B总参数、49B激活参数的MoE架构,支持1M上下文,但每次查询仅需关注2048个token。
要点
- 总参数770B,激活参数49B,包含256个路由专家和1个共享专家。
- 支持1M上下文,但通过稀疏注意力每次查询只处理2048个token。
- 78层中仅21层自行计算稀疏索引,其余57层复用同一索引,显著降低开销。
- 检查点内置10B MTP层(激活0.7B,草稿深度3),通过VLLM_ENABLE_HPC_OPS=1启用HPC-Ops内核。