核心信息

Meta Superintelligence Labs 推出 Muse Voice Transcribe,这是其首个实时音频感知模型,可在单一模型中完成流式语音转文本、说话人分离和端点检测,并宣称在流式 ASR 上达到 SOTA 水平。

要点

  • 已通过 Meta Model API、Meta AI for Mac 和 Muse Code 提供。
  • 采用自适应延迟,在“最终转录时间”衡量的速度与准确率权衡上达到帕累托前沿。
  • 原生支持 20+ 说话人分离,简化多说话人转录流程。