一种基于点积自注意力卷积神经网络的歌声检测方法,采用对数梅尔时频图输入,借助Pytorch平台的Homura包进行开发和实现,在卷积神经网络中嵌入点积自注意力模块,嵌入方法是在两个卷积组模块后分别嵌入点积自注意力模块对其输出的特征进行注意力权重重估,并把重估后的特征图送入到网络的下一层,这种注意力重估机制使得各特征得到网络不同的对待,从而提升整体网络性能。本发明的点积自注意力模块对传统应用于机器翻译的点积自注意力模型进行了改进,首先是使得向量键值对<k,v>和查询向量q的长度不等,其次对q,k,v的表达含义进行重新定义,再次增加了注意力分布变换机制。
📄 2021101923004
📂 G10L25_78
👤 金陵科技学院
📅 2021-02-20