糖尿病康复,内容丰富有趣,生活中的好帮手!
糖尿病康复 > 声纹技术(五):声纹分割聚类技术

声纹技术(五):声纹分割聚类技术

时间:2023-07-07 01:48:32

相关推荐

声纹技术(五):声纹分割聚类技术

5.1分割聚类:更好地理解对话语音

5.1.1关于名称与历史

声纹分割聚类(speaker diarization)是声纹领域里仅次于声纹识别的第二大课题,其难度远大于声纹识别。声纹识别所解决的问题可以简单概括为——“这是谁说的”,而这其中便包含了一个假设,那就是已知待识别的语音中,有且仅有一个说话人的声音。而在声纹分割聚类问题中,我们却推翻了这个假设,也就是说,一段语音中可以包含多个说话人交替说话的声音。因此,声纹分割聚类所解决的问题可以概括为——“谁在什么时间说的”(who spoke when)。

英文中diarization 一词,来源于单词diary,也就是日记或日志。从diary 到动词diarize,再到名词diarization,从字面来说,可以理解为“使……成为日志”,或者说“日志化”。一般而言,一篇日志通常会记载在一天的时间里,什么人在什么时间做了什么事。那么引申到speaker diarization,自然就可以理解为“什么人在什么时间说了什么话”。

关于speaker diarization 这个名称最早的由来,已经难以考究了。一些早期的文献直接将该问题称作speaker segmentation and clustering[114,115],这也是为什么较多的中文文献将其翻译为“声纹分割聚类”[116]。不过随着该领域的发展,尤其是近年来监督式方法(见5.5 节)甚至是端到端模型(见5.5.6 节)的出现,“分割聚类”这个名称已经不再合适了。无论是分割还是聚类,都可以用其他方法来替代。笔者比较喜欢的另一个中文翻译是“声纹分时归档”

如果觉得《声纹技术(五):声纹分割聚类技术》对你有帮助,请点赞、收藏,并留下你的观点哦!

本内容不代表本网观点和政治立场,如有侵犯你的权益请联系我们处理。
网友评论
网友评论仅供其表达个人看法,并不表明网站立场。