本发明公开了基于图结构差异分析的视频摘要自动生成方法及系统,包括:对给定视频流进行预处理,对预处理后的视频流中的每一帧图像划分为若干个均等大小的图像块;对每个图像块进行特征提取,得到每一帧图像每个图像块的特征向量;根据每一帧图像每个图像块的特征向量,建立每一帧图像的无向加权图;基于图结构差异分析的假设检验检测视频镜头边界;基于每个视频镜头的中值图,提取每个视频镜头中的关键帧。本公开解决了原始特征可能不能完全捕获帧中的详细结构信息的问题,使我们的方法更健壮地检测各种类型的镜头转换。
📄 2020103768136
📂 G06F16_738
👤 山东师范大学
📅 2020-05-07
本发明公开了一种运动与外观解耦的多尺度交互与语义校准视频摘要方法,属于计算机视觉技术领域。所述方法包括:对输入视频帧序列分别提取多尺度运动特征和外观特征,得到对应特征金字塔;将运动特征金字塔和外观特征金字塔输入视频摘要模型,通过模型预测初始帧级重要性分数序列;再通过双向LSTM捕捉帧间时序依赖,强化关键动作边界的分数,并通过多样性惩罚减少冗余帧,输出优化后的帧级重要性分数序列;最后通过施加时间间隔约束优化帧分布,经通过贪婪算法选择关键帧生成视频摘要。本方法有效解决现有视频摘要方法中运动与外观特征耦合、多尺度表征不足、特征融合机制简单、模态权重失衡问题,在SumMe和TVSum基准数据集上的实验结果证明了其有效性。
📄 2025112980653
📂 H04N21_8549
👤 石家庄铁道大学
📅 2025-09-11