核心信息
Meta Superintelligence Labs 推出 Muse Voice Transcribe,这是其首个实时音频感知模型,可在单一模型中完成流式语音转文本、说话人分离和端点检测,并宣称在流式 ASR 上达到 SOTA 水平。
要点
- 已通过 Meta Model API、Meta AI for Mac 和 Muse Code 提供。
- 采用自适应延迟,在“最终转录时间”衡量的速度与准确率权衡上达到帕累托前沿。
- 原生支持 20+ 说话人分离,简化多说话人转录流程。
Meta Superintelligence Labs 推出 Muse Voice Transcribe,这是其首个实时音频感知模型,可在单一模型中完成流式语音转文本、说话人分离和端点检测,并宣称在流式 ASR 上达到 SOTA 水平。