本发明公开了一种基于语音理解的短视频自动生成字幕的方法及系统,用于自然语言处理领域,该方法包括以下步骤:收集短视频的语音数据样本和文本数据;构建语音识别模型,同时依据文本数据构建语言理解模型;通过改进Bagging算法构建端到端语音理解模型;结合阈值法和视频信息的端点检测算法,提取出音频数据;将提取的音频数据输入端到端语音理解模型,生成对应的文本语义信息;将文本语义信息与视频时序信息相结合,自动渲染生成字幕;提供交互接口,对语音识别的错误结果进行校正。本发明共享语义表示,两任务互促进,语音编码器提取的语义特征可同时服务于语音识别和语言理解任务,两任务在统一模型中进行联合优化。
📄 2023112546805
📂 G10L15_18
👤 北京华星酷娱文化传媒有限公司
📅 2023-09-27
本发明提供一种电子装置,该电子装置包括智能语音导航系统。该智能语音导航系统包括:接收模块,用于接收用户输入的语音数据;识别模块,用于将接收到的语音数据转换为文字信息,分析所述文字信息中是否含有预先确定的业务关键词;第一执行模块,用于在所述文字信息中含有预先确定的业务关键词时,通过预先确定的业务关键词与业务服务节点的映射关系,确定所述文字信息中的业务关键词对应的业务服务节点,将当前服务流程流转至确定的业务服务节点。本发明还提供一种智能语音导航方法。
📄 2017103273729
📂 G10L15_18
👤 平安科技(深圳)有限公司
📅 2017-05-10
本发明涉及电子设备技术领域,公开一种语音误唤醒的规避方法及电子设备,包括:当检测到输入的语音唤醒指令时,获取当前时刻;检测当前时刻是否处于预设的免打扰时间段内;如果是,确定语音唤醒指令为误唤醒指令。实施本发明实施例,能够获取用户输入电子设备的语音唤醒指令的当前时刻,并根据当前时刻对应的时间段确定输入的语音唤醒指令的类型,如果当前时刻处于免打扰时间段,则可以认为用户输入语音唤醒指令为误操作,因此可以将用户输入的语音唤醒指令确定为误唤醒指令,以使电子设备不执行该语音唤醒指令对应的操作,从而提升电子设备的使用体验。
📄 2019104555172
📂 G10L15_18
👤 广东小天才科技有限公司
📅 2019-05-28
本发明提供了一种基于机器学习的语音识别分类方法及系统,应用于数据处理技术领域。本申请对目标语音的应用场景信息进行领域特征提取,生成分类任务影响因子;对目标语音流信息进行时频分析处理,生成标准化语音特征矩阵;基于目标用户的分类需求信息对标准化语音特征矩阵进行特征维度筛选,生成目标声学特征向量;对目标语音的采集设备信息进行信号特性分析,生成设备补偿特征向量;基于声学训练集对预设语音分类模型进行迁移学习,生成自适应语音分类模型;将分类任务影响因子、目标声学特征向量和设备补偿特征向量输入自适应语音分类模型,通过注意力机制进行特征融合,生成带置信度的语音分类结果信息。
📄 2025102814746
📂 G10L15_18
👤 泉州信息工程学院
📅 2025-03-11
本发明公开一种语音输入方法、系统及可读存储介质,包括:获取用户输入的第一待识别语音;根据第一语速信息以及语音时长得到第一待识别语音的字符数,并对第一待识别语音进行分析,得到与第一待识别语音相对应的第一语音内容;获取用户输入的第二待识别语音,并判断第二待识别语音的字符数是否大于第一待识别语音的字符数;若不大于,则判断与第二待识别语音相对应的第二语音内容是否为第一语音内容的子语音内容;若为子语音内容,则基于第二语音内容对第一语音内容进行更新,并输出更新后的第一语音内容。实现了不同语速的语音适用于不同的语音识别模型,解决采用通用的语音识别可能存在识别无效如识别不准确的问题。
📄 2023100727903
📂 G10L15_18
👤 天创光电工程有限公司
📅 2023-02-07