核心信息
Meta Superintelligence Labs 发布了 Muse Voice Transcribe,这是一款实时音频感知模型,支持流式语音转文字、20+ 说话人分离和端点检测,并具备多语种混说切换与偏好设置能力。
要点
- 实时流式语音识别,支持 20+ 说话人分离和自动端点检测。
- 多语种支持,可无缝切换语种;通过语言、关键词和上下文偏好提升准确率。
- 在 Artificial Analysis 流式语音转文字及公开说话人分离基准上排名第一。
Meta Superintelligence Labs 发布了 Muse Voice Transcribe,这是一款实时音频感知模型,支持流式语音转文字、20+ 说话人分离和端点检测,并具备多语种混说切换与偏好设置能力。