另外 , 这样的帧到帧映射模型不能转换时长 。 而实际情况是有的人说话比较快 , 有的人说话比较慢 , 怎么把说话人的语速特点体现出来呢?
这是我们设计的模型结构 。 模型输入除了从源说话人语音中提取的声学特征序列外 , 还拼接了利用语音识别声学模型提取的文本相关特征 , 以协助序列对齐 。 模型输出就是从目标说话人平行语句中提取的声学特征序列 。 其中输出与输入序列长度并不一致 。
以下是实验结果 。 图中横坐标是真实目标说话人语音的时长 , 纵坐标是转换后的语音时长 。 如果语音转换模型有比较好的时长调整效果 , 那么数据点应该落在对角线上 。 图中绿色点所示的是传统逐帧转换方法的结果 , 从中可以看出源与目标发音人之间显著的语速差异 。 红色点对应的是所提出的序列到序列语音转换方法 , 可以看出其取得了良好的时长转换效果 。
已有的非平行语料语音转换大体上有两个思路:
基于非平行数据构造平行数据 。 构造方法包括语音合成、帧挑选等 。 CycleGAN神经网络模型也可以归入此类方法 。
分离语音中的文本与话者表征 。 包括利用语音识别器提取音素后验概率(PPG)的方法 , 以及基于自编码器与变分自编码器的方法等 。
推荐阅读
-
-
空调制热多少度睡觉最舒服 空调制热一般多少度睡觉最舒服
-
人马君FITSTART|宋轶把旗袍穿出灵魂,古丽热巴惊艳沙漏身材,拥有完美腰臀比的女人能有多撩人?
-
「智道足球」皇马“卖人”一喜一悲!西媒:J罗今夏自愿转会,贝尔拒绝离队,原创
-
临床用药|硝普钠应该选用糖水还是盐水配?,糖尿病酮症酸中毒合并心衰
-
上海市城市管理行政执法局网站|浦东城管泥城中队:推进联勤联动站建设,践行“人民城市”理念
-
环球网|美国上千万租房户,或面临被驱逐困境!因为...
-
感觉自己学理工科专业没有天赋,是不是应该转到自己喜欢的文科专业
-
投资增长|深圳前8个月固定资产投资增长10.2%,增速高于上半年
-
「路咖汽车」但广州的指标计划正在酝酿中,北京投放新能源指标是假
-
「电商」被污名化的农民:当一斤粮食不及一瓶水贵时,凭什么要
-
亚太日报财经|美媒呼吁拉美快“捡漏”,欧美工厂从中国迁出
-
-
-
-
别克|越卖越好的丰田新SUV,发动机热效率41%,一公里3毛,靠亲民走量
-
八道冬季居家美味食谱,好吃到泪流满面,却停不下来,人暖心更暖
-
油菜花里拍照穿什么颜色的衣服好看,油菜花拍照适合什么颜色衣服-
-
-