Google DeepMind 发布 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话结合,为对话模型带来近实时的视觉形象,具备精准唇形同步、自然表情和流畅轮次切换。
推荐理由:官方给出 Live Avatar 的实时视频对话、异步工具调用与 97 种语言同步等能力边界,可据此判断企业级数字人对话的可用形态。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话结合,为对话模型带来近实时的视觉形象,具备精准唇形同步、自然表情和流畅轮次切换。
推荐理由:官方给出 Live Avatar 的实时视频对话、异步工具调用与 97 种语言同步等能力边界,可据此判断企业级数字人对话的可用形态。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体。
推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景中的分工。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向规模化低成本场景与高复杂度多步推理任务。
推荐理由:官方给出两款语音模型的基准成绩与开放入口,可据此判断实时语音智能体的能力水位。