跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

1条精选相关主题多模态AI 视频产品更新

最新精选

第 1–1 条 · 共 1 条
今天9月30日周三
  1. The Decoder78

    ElevenLabs 发布 Eleven v4 语音模型,并推出面向实时智能体的 Turbo 版本

    ElevenLabs 发布语音模型 Eleven v4,能更准确地遵循脚本中的情绪、停顿和音效标签,并在长内容制作中保持音色一致。新架构同时支撑 Turbo 版本,官方测试中约 150 毫秒开始输出语音,对比 Cartesia Sonic 3.6 的 262 毫秒和 OpenAI GPT-4o mini TTS 的 814 毫秒。

    推荐理由:Eleven v4 在语音一致性与实时延迟上的具体指标,可供做语音智能体和配音的团队比较选型。