本发明涉及一种电子助视器及其适用的智能手机文本辅助阅读方法,未识别到手势时抓拍一帧图像并保存,得到图像中文本的检测识别结果,为第一帧图像则将文本输出至语音播放模块播放,否则以该文本与上一帧的识别文本进行相似文本识别,基于是否相似选择去重播报或要求用户重选页面;基于是否收到关闭信息进行程序的关闭或反复。本发明使得低视力人群在手机使用场景下能通过电子助视器实现文本的流畅阅读,极大改善视障用户在使用智能手机时的文本阅读体验,一定程度解决手机应用在不支持无障碍模式下的文本阅读问题,亦可在用户自行选择下对文本进行识别播报,使视障用户可以从繁忙操作中解放出来,改善文本阅读体验,提高阅读效率。
📄 2020111988180
📂 G06V30_414
👤 浙江工业大学
📅 2020-10-31
本发明公开了一种基于Transformer的中文环境数学公式提取以及识别方法。该方法包括在中文环境下将含有数学公式的图片输入数学公式掩模提取模块,提取获得含有数学公式的掩模,在该掩模中仅保留了数学公式部分而剔除了其他位置的文字部分;再输入进入数学公式图片提取模块,该模块通过形态学方法对掩模中的数学公式位置进行进一步的修补以及完善,根据修复后的掩模生成数学公式图片;再输入进入转换展示模块,经过该模块处理得到该公式的Latex,并通过Katex再生成数学公式图片进行展示和对比。本发明方法基于Transformer技术提高了公式提取以及公式识别的准确率。不同于现有技术,本发明可以自动对输入图片的公式区域进行推断,使用起来更加方便。
📄 2022107723627
📂 G06V30_414
👤 浙江工业大学
📅 2022-06-30
本发明公开了一种基于行文本框纵向合并的文本内容提取识别方法,利用手指在设备摄像头下指出想要查看的题目,以图片的形式上传到服务器,通过简单算法就可以将和本题相关的所有的文字用一个矩形框框选出来,实现一个行的纵向合并,并且将矩形框中文字呈现出来。本发明根据文本框的位置信息、语义信息以及手指坐标信息,使用简单高效的算法实现多行相关文本框的合并,并将合并后文本框中的内容输出,该算法简单高效,解决了服务器资源不足的问题。同时本发明使用目标检测和手部检测识别实现找到手指关键点的坐标,使用现有模型加上后期训练后,精度提高,速度变快,可以更好配合文本框合并的算法。
📄 2022104997964
📂 G06V30_414
👤 浙江理工大学
📅 2022-04-28