跳到正文
原文
Kimi 官方 Blog·· 事件 2025-04-25精选AI 评分69

Kimi 发布开源音频基础模型 Kimi-Audio-7B

Kimi-Audio

AI 导读

Kimi 发布开源音频基础模型 Kimi-Audio-7B,在单一框架内统一处理语音识别、音频理解、音频描述、情感识别、声事件分类和端到端语音对话等任务。模型基于 Qwen 2.5 7B 初始化,预训练数据超过 1300 万小时音频与文本,采用连续声学向量加离散语义 token 的混合输入和并行文本与音频 token 生成头。

推荐理由

原文给出开源音频基础模型的架构、13M 小时预训练规模和多项基准对比,读者可据此判断统一音频处理框架的当前水平。

来源:Kimi 官方 Blog · github.com