本发明公开了基于图结构差异分析的视频摘要自动生成方法及系统,包括:对给定视频流进行预处理,对预处理后的视频流中的每一帧图像划分为若干个均等大小的图像块;对每个图像块进行特征提取,得到每一帧图像每个图像块的特征向量;根据每一帧图像每个图像块的特征向量,建立每一帧图像的无向加权图;基于图结构差异分析的假设检验检测视频镜头边界;基于每个视频镜头的中值图,提取每个视频镜头中的关键帧。本公开解决了原始特征可能不能完全捕获帧中的详细结构信息的问题,使我们的方法更健壮地检测各种类型的镜头转换。
📄 2020103768136
📂 G06F16_738
👤 山东师范大学
📅 2020-05-07
本申请公开了基于特征融合和增量滑动窗口的视频摘要生成方法及系统,对待处理视频基于图建模的方式进行特征表示,得到每一帧图像对应的若干个图特征表示;计算每一帧图像的若干个图特征表示与中值图的对应特征表示之间的特征差异值;对每一帧图像的所有特征差异值进行自适应加权求和,得到每一帧图像的差异度量;采用自适应长度的滑动窗口对待处理视频进行滑动检测;在滑动窗口滑动检测的过程中,假设滑动窗口内R帧图像的差异度量符合正态分布,计算第R+1帧的差异度量是否符合同一正态分布;如果不符合则表示存在镜头边界;对每个镜头中的所有帧图像进行聚类处理,获取关键帧;将所有的关键帧按照时间顺序进行排列生成视频摘要。
📄 2020115867804
📂 G06F16_738
👤 湖北华中电力科技开发有限责任公司
📅 2020-12-28
本发明公开了一种层次化跨模态交互的无监督视频摘要生成方法,属于计算机视觉技术领域。所述方法包括:读取输入的视频帧序列,通过特征提取器分别提取视频静态特征和动态特征,得到帧级静态特征序列和动态特征序列;利用基于核的分割算法将视频划分为语义连贯的镜头子序列;接着将帧级静态特征序列和动态特征序列输入视频摘要生成模型,通过模型预测镜头级重要性分数序列;之后构建目标损失函数,采用无监督方式训练上述的视频摘要生成模型;将训练得到的视频摘要模型对新视频进行预测,根据生成的镜头级重要性得分序列生成视频摘要;本方法解决了现有视频摘要方法中在跨模态交互不足,偏离全局语义的问题。
📄 202511787837X
📂 G06F16_738
👤 石家庄铁道大学
📅 2025-12-01
本发明公开了一种基于全局多尺度编码与局部稀疏注意力的视频摘要生成方法,属于计算机视觉技术领域。所述方法包括:读取输入视频,提取输入视频的帧级特征向量;构造视频摘要生成模型,将帧级特征向量输入视频摘要模型;将全局多尺度编码和局部稀疏注意力模块的输出进行自适应融合,生成融合特征;融合特征经回归网络输出帧重要性分数,选出代表性帧,生成视频摘要。本发明所提视频摘要方法通过结合全局多尺度编码与局部稀疏注意力机制,能够精确识别视频中的关键片段,显著提升视频浏览效率和用户体验。实验在基准数据集SumMe和TVSum上进行,实验结果充分证明了该方法的有效性。
📄 2025107722257
📂 G06F16_738
👤 石家庄铁道大学
📅 2025-06-11
本申请实施例提供一种视频描述方法及装置、计算机设备和存储介质,其中,将待描述的视频分割为N个片段;获取预设的网络模型输出的第P个文本特征,所述N为大于等于2的整数,P为大于等于1且小于等于N的整数;将所述N个片段和所述第P个文本特征输入所述网络模型,得到第(P+1)个文本特征;输出所述第(P+1)个文本特征;如此,通过根据前一个文本特征生成下一个文本特征,大大减少了描述视频的文本的冗余,使得文本中的语句更加连贯且简洁。
📄 201810814079X
📂 G06F16_738
👤 北京市商汤科技开发有限公司
📅 2018-07-23
本发明公开了一种基于语义自挖掘的视频摘要生成方法。该方法包括:S1,读取视频帧序列,并利用特征提取器提取帧级视觉特征;S2,构建视频摘要生成模型,将所述帧级视觉特征送入所述视频摘要生成模型中生成预测得分向量;S3,构建均方误差损失函数,增加预测得分与人工标注得分之间的一致性,并迭代优化网络参数,训练所述视频摘要生成模型;S4,利用S3训练得到的视频摘要生成模型对输入视频执行上述S1和S2,根据预测得分向量生成关键镜头集合。所提方法可以有效地处理任意时长的视频,并且通过深入挖掘输入视频本身的语义表征使得该方法可以更加准确地定位视频中的关键片段。在基准数据集上的实验结果充分证明了其有效性和先进性。
📄 2023103530193
📂 G06F16_738
👤 石家庄铁道大学
📅 2023-04-04