TTS 文本转语音 TTS 文本转语音 基本流程 文本 前端(分词、韵律、音素) G2P、多音字、韵律预测 预测 声学模型 声码器 波形 mel 谱或线性谱 Griffin-Lim、神经声码器 端到端:文本直接到波形 VITS、Bark、少步扩散 单模型、低延迟 模型与技术 传统:拼接合成、统计参数合成 神经 声码器:HiFi-GAN、BigVGAN、扩散模型 多音色与情感 说话人嵌入、多说话人建模 情感、语速、停顿控制 多语种与跨语言克隆 应用 朗读、有声书、配音 多角色、情感控制 克隆、少样本音色 语音助手、机器人播报 播报队列、打断与恢复 多语种、口音 实时 TTS、低延迟流式 流式声码器、chunk 合成 首包延迟、RTF