VibeVoice

VibeVoice
软件描述
VibeVoice 是一种新颖的框架,旨在从文本生成具有表现力的长篇多说话人对话音频,例如播客。它解决了传统文本到语音(TTS)系统中的诸多挑战,特别是在可扩展性、说话人一致性等方面。
官方网站
访问软件的官方网站了解更多信息
microsoft.github.io
安全链接HTTPS
什么是 VibeVoice?
VibeVoice 是一种新颖的框架,旨在从文本生成具有表现力的、长篇的、多说话人对话音频,如播客。该框架解决了传统文本到语音(TTS)系统中的诸多挑战,特别是在可扩展性、说话人一致性以及自然的轮流对话方面。
VibeVoice 的核心创新在于采用连续语音分词器(声学分词器和语义分词器),其运行帧率低至每秒7.5帧。这些分词器在高效保持音频保真度的同时,显著提升了处理长序列的计算效率。VibeVoice 采用“下一个词扩散”框架,利用大型语言模型(LLM)理解文本上下文和对话流程,并通过扩散头生成高保真的音频细节。
该模型可合成长达90分钟、最多包含4个不同说话人的语音,超越了以往多数模型通常仅支持1到2个说话人的限制。
🔄 替代方案
54 个选择
Podium.page
Podium 是一家终极的播客编辑服务,它利用人工智能生成的节目简介、摘要、章节、字幕和精彩片段,大幅提升您的后期制作流程。借助 Podium 的人工智能写作软件,您可以生成高质量的节目简介和摘要,……
免费增值 • 专有
查看详情