分享
语音合成
输入“/”快速插入内容
语音合成
语音合成
(
Text to Speech
,
TTS
)是指将文本通过一系列的信号处理转换成“人造”语音。
技术原理
传统的
语音合成
技术一般会经过文本与韵律分析、声学处理与声音合成三个步骤。
1.
文本与韵律分析:先将文本分词;再标明每个字的发音以及重音、停顿等韵律信息;然后提取文本的特征,生成
特征向量
。
2.
声学处理:通过
声学模型
将文本
特征向量
映射到声学特征向量。
3.
声音合成:使用
声码器
将声学
特征向量
通过反变换生成声音
波形
,然后一次拼接得到整个文本的合成语音。在反变换过程中,可以调整参数,从而改变合成语音的音色、语调、语速等。
参考资料
CUI三部曲之语音合成——机器如何回答你的话?