跳到正文

#语音

今日 0 条
9月25日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话结合,为对话模型带来近实时的视觉形象,具备精准唇形同步、自然表情和流畅轮次切换。

    推荐理由:官方给出 Live Avatar 的实时视频对话、异步工具调用与 97 种语言同步等能力边界,可据此判断企业级数字人对话的可用形态。

9月23日周三
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体。

    推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景中的分工。

9月16日周三