核心信息

Grok Voice 已在 fal 上线,开发者可用它构建智能、低延迟的语音智能体。该模型支持 0.70 秒响应、在语句结束前完成工具调用、词级时间戳转写,以及 30+ 音色、25+ 语言的文本转语音。

要点

  • 在 fal 上构建能真正解决客户问题的低延迟语音智能体。
  • 0.70 秒内即可回答,并能在句子说完前完成工具调用。
  • 支持词级时间戳转写,以及 30+ 音色、25+ 语言的 TTS。
  • 仅需两分钟音频即可克隆声音;演示视频中的全部声音均来自 Grok Voice。