核心信息
Grok Voice 已在 fal 上线,开发者可用它构建智能、低延迟的语音智能体。该模型支持 0.70 秒响应、在语句结束前完成工具调用、词级时间戳转写,以及 30+ 音色、25+ 语言的文本转语音。
要点
- 在 fal 上构建能真正解决客户问题的低延迟语音智能体。
- 0.70 秒内即可回答,并能在句子说完前完成工具调用。
- 支持词级时间戳转写,以及 30+ 音色、25+ 语言的 TTS。
- 仅需两分钟音频即可克隆声音;演示视频中的全部声音均来自 Grok Voice。
Grok Voice 已在 fal 上线,开发者可用它构建智能、低延迟的语音智能体。该模型支持 0.70 秒响应、在语句结束前完成工具调用、词级时间戳转写,以及 30+ 音色、25+ 语言的文本转语音。