核心信息

Perplexity 在 M5 Max MacBook Pro 上对开源 Apple 芯片推理引擎 Lily 进行了基准测试,结果显示其在十种 prompt 长度和十种 decode 上下文中均稳定优于 MLX-LM。

要点

  • Lily 的平均 prefill 吞吐为 MLX-LM 的 1.23 倍,decode 吞吐为 MLX-LM 的 1.35 倍。
  • 输出质量在对比中基本保持不变。
  • 基准测试针对 Qwen3.6-35B-A3B,这是 Lily 专门优化的模型。
  • Lily 面向 Perplexity Computer 的混合计算设计,现已作为开源本地推理引擎发布。