本发明涉及场景文本分割领域,具体是一种基于改进SAM视觉分割大模型的场景文本分割方法,本发明以SAM视觉大模型为基础,通过图像内容感知模块提取文本内容感知特征,文本边缘感知模块提取文本边缘感知特征,并通过文本特征融合模块提取计算文本边缘感知特征图在SAM编码器的每次自注意力计算前与需要注意力计算的向量进行相加来提高SAM在文本分割方面的准确率,并能够在保证泛化性的前提下缩短模型的训练时间。
📄 2025102157674
📂 G06V30_148
👤 浙江工业大学
📅 2025-02-26
本发明提出了一种基于运算符和中心线的数学公式识别的方法,其主要思路为:对公式图片进行切割;应用卷积神经网络(CNN)网络结构对字符图片进行识别;充分利用公式中不同种类运算符作用域固定的特点将其分为三类,分别是分号、特殊运算符和二元运算符号,其中特殊运算符包括根号、求和符号、积分符号等大符号,这些运算符有多个作用域,先将这些作用域内的子式判别出来并进行识别,将识别结果直接送入运算符的Latex语言表达式;然后基于字符在书写时受四线格约束的情况,提出中心线的概念,将常见字符分类为向上类、向下类、全占类和中心类,依据字符的中心线类别不同计算阈值,判断两个字符之间的上下标的位置关系。最终实现公式识别。
📄 2020116388900
📂 G06V30_148
👤 中传华夏(青岛)产业控股有限公司
📅 2020-12-31
本发明公开了基于深度学习的试卷批改方法,包括:获取写有标准答案的试卷图像P1,采集需要批改的试卷图像P2,并进行预处理;对预处理后的P1和P2分别进行霍夫直线检测,得到答题水平直线位置,进而得到单个题目的答题区域;利用YOLO v3网络提取答题区域中每个验证框的坐标信息及验证框内的数据,进而计算相邻两个验证框之间的距离;对两幅试卷图像中同一个题目序号对应的答题区域中每个数据信息进行比对,统计需要批改的试卷图像中正确题目与错误题目数量;根据需要批改的试卷坐标信息,提取需要批改的试卷对应的学号,将学号与相应试卷上所有题目正确与否存入数据库中。本发明可运用于试卷或者答题卡的选择题、填空题,不受题型以及答题卡格式的限制。
📄 2022101605824
📂 G06V30_148
👤 无锡学院
📅 2022-02-22
本发明公开了一种数字仪表示数端到端识别方法,包括获取原始数字仪表示数图像;从原始数字仪表示数图像中提取多张特征图,组成初始特征金字塔;对初始特征金字塔进行多尺度和多层次的特征融合,得到带有示数位置信息的特征图;对带有示数位置信息的特征图进行图像分割,生成概率图和阈值图;基于概率图和阈值图通过自适应可微二值化方法预测示数位置,得到近似二值图;以近似二值图作为二值掩膜,从带有示数位置信息的特征图中提取示数区域的特征图块;对示数区域的特征图块进行示数识别,得到数字仪表示数内容。本发明可以有效减少每个步骤的时间开销,在保持具有竞争力的准确性的同时还能够达到较高的推理速度。
📄 2023104113402
📂 G06V30_148
👤 成都天合一成科技服务有限公司
📅 2023-04-13
本发明公开一种基于OCR的证件识别方法、装置、计算机设备及存储介质,该基于OCR的证件识别方法包括:获取原始证件图像和证件类型;对原始证件图像进行预处理,获取待识别证件图像;采用文字定位模型对待识别证件图像进行文字定位,获取待识别文字位置;基于待识别文字位置,对待识别证件图像进行裁剪,获取待识别文字区域;采用与证件类型相对应的预设区域模板对待识别文字区域进行分类,获取待识别文字区域对应的文字类别;基于待识别文字区域对应的文字类别,将待识别文字区域输入到与文字类别相对应的目标识别模型中进行识别,获取待识别文字区域对应的证件文本信息,该基于OCR的证件识别方法可有效提高证件图像识别的准确率和效率。
📄 2018111821448
📂 G06V30_148
👤 平安科技(深圳)有限公司
📅 2018-10-11
本发明实施例涉及智能设备技术领域,公开了一种智能框题的方法、装置、电子设备及存储介质。该方法包括:当接收框题指令时,采集包含有目标题目的图像;识别所述目标题目中各个字符在所述图像中的位置坐标;依次连接所述目标题目中首行的顶点位置坐标形成第一连线,并依次连接所述目标题目中末行的底部位置坐标形成第二连线;获取智能框中所述目标题目的内容的图片;所述智能框为所述第一连线和所述第二连线围成的区域。实施本发明实施例,可根据目标题目的字符方向自动调整智能框,避免目标题目不完整或框取到无效信息,提升框题效率,改善用户体验。
📄 2020103666147
📂 G06V30_148
👤 广东小天才科技有限公司
📅 2020-04-30
本发明涉及一种基于类编解码结构的草图语义分割方法,属于计算机视觉技术领域。具体地,将草图视为二维点集合,通过利用笔画内部结构和采样点的空间位置关系开发了新颖的局部特征聚集模块,该模块编码了丰富的局部特征,并定义了笔画距离,用于兼顾草图的二维空间分布和笔画结构;设计了线段层次自注意力模块用于建立和增强草图线段之间的关系,线段层次自注意力模块更好地描述了草图的内部结构;基于全局注意力机制,提出了末尾具有两个子分支的类编解码结构,包括:点层次子分支和线段层次子分支;最终,两个子分支的输出融合在一起生成语义分割结果。本发明相对于已存在的方法,具有更精准的分割结果和较高的鲁棒性。
📄 2022106552787
📂 G06V30_148
👤 燕山大学
📅 2022-06-10
本发明提出了一种基于点‑线段层次交互的草图语义分割方法。具体地,本发明基于邻近点和中心点的距离信息开发了增强型局部特征聚集模块,该模块考虑了邻近点对中心点的不同影响。基于增强型局部特征聚集模块,本发明构建了密集连接的编解码结构,并基于该结构搭建了点层次分支网络和线段层次分支网络用于同时从两个层次编码草图语义。为了解决由于特征选择和提取造成的语义细节丢失的问题,本发明设计了点‑线段层次交互模块。点‑线段层次交互模块放置在解码部分的若干阶段,有利于保留和利用有用的语义细节。最终,点层次特征和线段层次特征进行融合,获取语义分割结果。本发明相对于已存在的方法,具有分割精度高,计算复杂度低等优点。
📄 2022110702147
📂 G06V30_148
👤 燕山大学
📅 2022-09-02
本发明公开了基于跨模态文本语义驱动的少样本缺陷识别方法,属于图像处理技术领域。本发明针对工业质检场景中异常样本稀缺且缺陷类型动态演化导致的检测模型泛化不足问题,通过建立动态特征重组机制与自适应判别边界,实现仅需少量正常数据即可精准识别未知的缺陷类型;本发明通过文字描述与图像特征的匹配关系,在正常样本上生成与真实缺陷形态相近的模拟样本;当遇到未见过的缺陷类型时,可以根据文字语义自动调整图像纹理的对比标准,准确区分正常区域与异常区域的细微差异,无需依赖真实缺陷数据,进而提高样本缺陷识别精度。
📄 2025110892959
📂 G06V30_148
👤 南京信息工程大学
📅 2025-08-05
本发明公开了一种变压器铭牌信息采集方法,包括使用摄像设备获取变压器铭牌图像;采用轻量化神经网络图像识别程序在变压器图像采集现场对变压器铭牌图像进行分割,分割出变压器铭牌图像中的字符小图片;采用PCAnet网络计算机程序对步骤2的字符小图片进行识别,将字符小图片转换为字符;将步骤3得到的变压器铭牌信息进行登记。本发明还公开了2种变压器铭牌信息智能采集系统。本发明在变压器铭牌现场取像后,将铭牌信息的识别分成两步,大大减少了传输的图像数据,使得字符识别更加高效,后台的字符识别结果返回到变压器图像采集现场,便于核对字符识别结果,确保采集的变压器铭牌信息准确无误。
📄 2019111078375
📂 G06V30_148
👤 三峡大学
📅 2019-11-13
本发明公开了基于多层级深度特征融合的笔画提取方法,包括:获取汉字图像,构建汉字笔画分割数据集,对汉字图像上的笔画进行笔画标注,并将笔画掩膜、笔画长度、笔画掩膜的矩形框作为标签信息;搭建笔画分割模型,笔画分割模型包括汉字图像预处理模块、全局特征提取网络、主要视觉特征提取网络、时序特征提取网络、空间特征提取网络;对笔画分割模型进行训练和测试;将待测汉字图像输入笔画分割模型,得到笔画分割提取结果。相比传统的方法,从不同的层级提取特征,能够更全面地捕捉汉字笔画的信息如笔画的时序信息和空间信息等,提高提取的准确性和鲁棒性。
📄 2023108297918
📂 G06V30_148
👤 西安理工大学
📅 2023-07-07
本发明公开了一种基于多特征信息增强编码的三维点云语义分割方法。该发明可以进一步增强以PointNet++为代表的三维点云语义分割算法在不同应用场景下的性能。PointNet++网络在编码过程中,只是单纯的利用点和中心点的坐标差作为局部空间的几何信息构建显然是不够充分的。同时,对于点的附加信息,PointNet++网络直接将其和几何信息进行共同编码,这是一种对于点云附件信息的不恰当使用,点云信息在其中的作用很小。本发明提出的基于多特征信息增强编码的三维点云语义分割方法,添加点与中心点的原始坐标和欧式距离等信息,与坐标差共同进行局部空间的特征聚合,并将点的附加特征和几何特征分开编码,重新设计了一种基于点云多类特征的信息编码增强结构。
📄 2021106172302
📂 G06V30_148
👤 电子科技大学
📅 2021-06-03