本发明公开了一种复杂自然场景图像中的文字检测方法,属于计算机视觉和模式识别领域,涉及神经网络和计算机视觉技术领域,特别是基于深度学习实现复杂场景下的文字检测方法。它通过融合了基于字符标注的文字检测方法和基于单词标注的文字检测方法,学习字符间的组合特征,能降低文字的误检率,降低检测框的冗余度,具有灵活应对任意形状文字的能力。一种复杂场景下的文字检测方法,它的方法步骤为:图像数据预处理、构建网络框架、对模型进行预训练、训练网络框架;文字真实标签生成、输入一张待检测的自然场景下的文字图像、特征提取、图像判定、文字校正模块。
📄 2020112926904
📂 G06V20_62
👤 湖南师范大学
📅 2020-11-18
本发明公开了一种融合复用Transformer的基于Mamba框架的场景文字识别方法,包括:构建多样化训练样本,与原始样本一起生成增广样本图像;特征编码后送入分层特征编码器进行特征提取;所述分层特征编码器包括多个级联的特征编码阶段,通过下采样模块对特征的空间分辨率和通道维度进行自适应调整;分层特征编码通过NA‑Mamba混合模块对二维场景文字特征进行建模,引入参数共享的复用Transformer模块对多阶段特征进行双向全局上下文建模与迭代增强,提取场景文字特征,送入基于双流注意力机制的序列解码器;通过交叉注意力生成字符序列,输出最终文字识别结果,提高了识别精度、参数效率及推理效率。
📄 2026103689413
📂 G06V20_62
👤 南京信息工程大学
📅 2026-03-25
本发明公开了一种基于图像的刻度识别方法,包括如下步骤:1)设计用于计算机识别的刻度线:1.1)在刻度线左右端分别设置图案以区分左右边界;1.2)对刻度线的中间刻度值进行编码;2)将刻度线贴在被测量的液体容器侧壁;3)获取刻度线图像:使用拍摄设备对液体容器侧壁位置处的刻度线图像进行抓取;4)将获取的刻度线图像送入算法识别器:4.1)通过图像左右边界,将刻度区域进行检测、定位,如果有倒置或倾斜,则将刻度区域进行校正;4.2)识别刻度线,将刻度线的编码转成比特序列;4.3)进行检错纠错;5)输出刻度值。本发明提供了一种全新的刻度编码图案方便于计算机识别达到较高的精度。
📄 2022116957741
📂 G06V20_62
👤 浙江工业大学
📅 2022-12-28
基于编码识别的机柜智能资产盘点方法,包括:步骤1编码标签图片预处理;步骤2构建与改进PSENet网络模型,模型包括特征提取模块、分割头模块以及后处理模块;步骤3识别带不同二进制数的资产标签,获取资产信息,其中识别标识之前需要通过卷积神经网络训练图片识别模型,达到通过给定图形或图案返回数字的效果;步骤4数据库存储资产信息;步骤5汇总资产数据,返回盘点信息。本发明一次可以抓取多个标识信息,识别后有唯一二进制编码,满足自然场景下对标签下对应的资产的管理需求。
📄 2020111247357
📂 G06V20_62
👤 浙江工业大学
📅 2020-10-20
本发明公开了一种基于超维计算的车牌检测与识别系统,包含基于改进YOLOv8的车牌检测模块、基于U2‑Net和畸变矫正的数据处理模块和基于超维计算的车牌识别模块,其中车牌检测模块利用改进后的YOLOv8模型对车牌照片进行检测;对检测后的车牌部分图片进行进一步的数据处理,最后使用基于超维计算的车牌识别模块对数据处理后的车牌数据进行识别,改进后的YOLOv8模型包括使用基于Repulsion的损失函数、增加特征增强模块、增加小目标检测头、改进非极大值抑制算法。本发明通过对YOLOv8算法改进,有效提升了车牌检测性能,并通过数据处理模块以及基于超维计算的车牌识别模块,将车牌检测速度大大提升。
📄 202311662294X
📂 G06V20_62
👤 淮阴工学院
📅 2023-12-05
本发明公开了一种基于ResUNet神经网络的化学结构式分割方法。本发明步骤如下:步骤(1)构造训练集T,训练集T包括手动标注训练集T‑1和自动生成训练集T‑2两部分;步骤(2)将训练集T送入ResUNet神经网络进行训练,达到训练指定次数或者Loss曲线不再下降且精度不再提高为止,将训练好的ResUNet神经网络模型保存;步骤(3)使用步骤(2)中训练好的ResUNet神经网络模型对化学结构式进行分割。本发明在ResUNet神经网络基础上,提出一种改进的ResUNet神经网络,同时,提出一种自动生成大量化学结构式训练集的方法进行训练集的生成,从而使ResUNet神经网络能够对化学结构式进行分割,达到以大量数据提升神经网络识别精度的目的。
📄 2020104195023
📂 G06V20_62
👤 杭州电子科技大学
📅 2020-05-18
本发明公开了一种基于实例感知成分合并网络的曲线文字定位方法,具体包括如下步骤:步骤1,在场景文字数据集官网下载场景文字图像数据集,将数据集划分为训练集和测试集;步骤2,设计一种ICMN网络结构;步骤3,定义ICMN网络目标损失函数;步骤4,制作训练样本集;步骤5,制作真值集合;步骤6,将训练样本集和对应的真值集合送入ICMN网络中训练,得到网络模型;步骤7,从测试集中取出一张图像,用曲线文字检测算法对图像进行多边形文字成分检测,将检测的多边形对迭代送入ICMN网络模型中进行多边形成分合并,得到合并后的文字实例多边形。本发明解决了场景文本检测方法对文本实例中相邻或相交文本成分的合并问题,提高了场景文本检测算法的性能。
📄 2020108582580
📂 G06V20_62
👤 西安理工大学
📅 2020-08-24
基于二值图像灰度共生矩阵的棒材端面字符图像识别方法,用于棒材端面白色标记字符的识别,所述方法包括如下步骤:(1)建立标准字符模板库;(2)棒材端面字符图像灰度二值化;(3)求取棒材端面字符图像的灰度共生矩阵及灰度组合GLCM(0,1)数目;(4)计算棒材端面字符图像上半部连通域面积;(5)进行特征数据模板匹配确定识别结果。本发明将灰度共生矩阵中灰度组合GLCM(0,1)数目作为特征参数值一,同时对二值字符图像的上半部求取连通域面积,将上半部连通域面积作为特征参数值二,基于二值图像的两组特征参数值进行匹配,减少了灰度共生矩阵的运算量,提高了运算速度和识别率。
📄 2019107982329
📂 G06V20_62
👤 河北科技大学
📅 2019-08-27
本申请公开了一种基于边端协同的工业仪表读数识别方法、装置、介质,方法包括:将初始CNN模型中的卷积层替换成深度可分离卷积层,得到第一中间模型;利用主成分分析算法和自动编码器分布特征压缩训练集,得到压缩特征,利用其训练第一中间模型,剪除模型中重要等级低于预设等级的卷积核,重新训练模型直至得到满足原来性能的目标模型;当接收到高清摄像头发送的第一图像,利用目标模型提取第一图像的目标图像特征并将其发至云端服务器以使云端服务器将目标图像特征输入深度学习模型得到工业仪表读数识别结果。本申请通过替换深度可卷积层、模型剪枝和保障性能指标的训练模型方案,保障读数识别结果的准确性同时降低模型在边缘设备的内存占用。
📄 2025100897299
📂 G06V20_62
👤 珠海科技学院
📅 2025-01-21
本发明公开了一种非限制场景下的实时车牌检测识别系统,应用于智能交通图像检测技术领域,其中包括:基于YOLOv5车牌检测网络与PDLPR车牌识别网络。在车牌检测模块使用当前目标检测效率较高的YOLOv5算法,在车牌识别模块使用本发明提出的PDLPR车牌识别算法,该方法包含一个能够提取全局特征信息的特征提取器,相比传统的特征提取方式,此方法能够提取丰富的语义信息;同时充分发挥多头注意力的优势,训练数据不需要逐个标注车牌中单个字符位置,车牌图片不需要辅助校正手段就可以进行精准识别,在车牌倾斜、光照条件恶劣、字符模糊等自然场景下都表现出良好的性能。
📄 2023105414214
📂 G06V20_62
👤 浙江理工大学
📅 2023-05-15
本发明公开了基于注意力机制特征融合与增强的自然场景文本检测方法和系统,方法包括,对自然场景文本图像进行特征提取得到第一特征图;进一步提取空间信息特征,得到空间信息掩码;对最后一个第一特征图进行语义信息的特征提取,获得通道权重向量;逐级对第一特征图、空间信息掩码、通道权重向量进行基于注意力机制的解码融合,得到第二特征图;对融合特征做通道数调整,按照通道维度拼接得到第三特征图;上采样到原图大小,并进行卷积,获得自然场景文本图像中文本核心区域和边界区域的分割掩模。本发明特征提取信息全面,效果好;解码后的特征包含更多更精准的目标信息;使用卷积与不同维度的池化操作提取更加显著的特征且起到抑制噪声的作用。
📄 2021113936202
📂 G06V20_62
👤 金陵科技学院
📅 2021-11-23
本发明涉及场景文本检测领域,尤其涉及一种社交图片文本识别方法、装置、计算机设备及存储介质,其方法包括:获取社交图片的二维图像特征;通过全局注意力交互机制对二维图像特征进行特征提取,得到二维视觉特征;将二维视觉特征输入字符视觉特征模型,获得一维字符视觉特征;将一维字符视觉特征输入字符语义特征模型,获得一维字符语义特征;通过融合特征算法对一维字符视觉特征和一维字符语义特征进行动态融合处理,得到社交图片的字符信息。本发明可对社交图片的字符语义特征进行矫正补充,提高了字符识别的准确率,且实现了并行处理,加快了识别处理速度,提高实时交互能力。
📄 2021107401934
📂 G06V20_62
👤 平安科技(深圳)有限公司
📅 2021-06-30