本发明提出了一种文本生成电影视频片段的方法、系统和设备。所述方法包括:连接到服务器的客户端电脑通过输入文字来生成电影视频片段。生成过程涉及一个处理模型,该模型可以根据文本语义生成与之匹配的目标片段的初始帧。在处理模型中,初始帧会接受注意力训练,以使生成的图像与动作相匹配。模型还会生成电影视频片段序列的图像,通过插值网络提高每秒帧数,使用超分辨率网络提升图像的像素和线条精度,最终得到连贯且高精度的电影视频片段。
📄 2023114307921
📂 H04N21_8549
👤 西南大学
📅 2023-10-31
本发明公开了一种运动与外观解耦的多尺度交互与语义校准视频摘要方法,属于计算机视觉技术领域。所述方法包括:对输入视频帧序列分别提取多尺度运动特征和外观特征,得到对应特征金字塔;将运动特征金字塔和外观特征金字塔输入视频摘要模型,通过模型预测初始帧级重要性分数序列;再通过双向LSTM捕捉帧间时序依赖,强化关键动作边界的分数,并通过多样性惩罚减少冗余帧,输出优化后的帧级重要性分数序列;最后通过施加时间间隔约束优化帧分布,经通过贪婪算法选择关键帧生成视频摘要。本方法有效解决现有视频摘要方法中运动与外观特征耦合、多尺度表征不足、特征融合机制简单、模态权重失衡问题,在SumMe和TVSum基准数据集上的实验结果证明了其有效性。
📄 2025112980653
📂 H04N21_8549
👤 石家庄铁道大学
📅 2025-09-11
本申请公开了一种视频摘要生成方法、装置、计算机设备和存储介质,涉及视频监控领域。本申请实施例提供的视频摘要生成方法,不仅获取第一监控设备的监控视频,还获取第一监控设备目标区域内的多个第二监控设备的监控视频,从多个第二监控视频中获取包括目标对象的至少一个第二监控视频,从而生成的目标视频摘要中不仅第一视频片段中包括目标对象,至少一个第二视频片段中的每个第二视频片段也包括目标对象,因此,该目标视频摘要包括的信息量丰富,可以拓展相关人员查找目标对象的维度和范围,提高目标对象的查找效率。
📄 2019105513054
📂 H04N21_8549
👤 杭州海康威视系统技术有限公司
📅 2019-06-24
本发明提供一种视频摘要生成方法及装置、设备、介质,该方法包括:在确定生成视频摘要中每个视频摘要帧所需的目标对象的位置信息时,依据缓存队列Q1中的剩余容量从数据库中获取未处理的轨迹并存入至Q1中,数据库中存储了从视频中确定出的目标对象的轨迹;按照指定要求确定Q1中需转存的轨迹T并转存至缓存队列Q2,取出Q2中轨迹上的指定轨迹点;将本次取出的指定轨迹点确定为生成当前视频摘要帧所需的目标对象的位置信息;判断当前已确定出位置信息的视频摘要帧的数量是否大于目标帧数,若否,继续确定生成下一个视频摘要帧所需的目标对象的位置信息,若是,依据已确定的生成各个视频摘要帧所需的目标对象的位置信息生成视频摘要。
📄 2019100498467
📂 H04N21_8549
👤 杭州海康威视数字技术股份有限公司
📅 2019-01-18
本发明公开了一种基于运动信息协助的视频摘要生成方法,用于自动地从视频中挑选最重要的片段,从而提升视频浏览效率。所提方法首先根据输入视频获取外观帧序列和运动帧序列,并采用神经网络模型分别提取外观特征和运动特征,然后根据镜头分割算法检测视觉变化点,得到子镜头集合,接着利用构建的视频摘要生成模型预测镜头级重要性得分,最后根据预测得分生成动态视频摘要。所提方法在使用静态的外观信息的基础上进一步引入了运动信息,通过实现有效的单模态特征编码以及跨模态特征交互提升了对视频内容的理解能力。在SumMe和TVSum两个基准数据集上的实验结果充分证明了所提方法的有效性和先进性。
📄 2023105041596
📂 H04N21_8549
👤 石家庄铁道大学
📅 2023-05-06
本发明公开了一种基于内容感知的视频摘要生成方法。该方法包括:通过特征编码器将视频帧编码为帧级特征向量;构建视频摘要生成模型预测帧级重要性分数;采用监督学习的学习范式训练所述视频摘要生成模型;选择包含最多关键信息的子镜头,输出动态视频摘要。实验在基准数据集SumMe和TVSum上进行,实验结果充分证明了该方法的有效性。本发明所提出的视频摘要算法,充分利用了注意力机制和卷积操作的全局和局部建模能力,可以准确地感知视频中的重要片段,提升视频浏览效率。
📄 2023100051750
📂 H04N21_8549
👤 石家庄铁道大学
📅 2023-01-04