发明专利 已授权

一种自适应结构化的文档抽取方法

📄 申请号:CN202011560863.6 📄 发布日:2026/02/05

著录项目信息

申请日
2020-12-25
申请人
杭州电子科技大学
法律状态
已下证
专利类型
发明
主分类号

技术画像

应用场景

文档自动化处理, 知识管理, 智能办公, 数据挖掘, 商业智能

摘要

本发明公开了一种自适应结构化的文档抽取方法。本发明首先从互联网中采集原始网页并存储,然后对采集到的原始网页中的原文进行通用无意义清洗,接下来根据Xpath定位网页中的元素,自动对比抽取出网页中有价值的内容,最后将抽取到的内容按照结构化的格式存储起来;通过改进的抽取规则实现不需要先验知识和人工标注数据,而是通过挖掘网页之间的语义相似性,自动生成适用的抽取模式。本发明抽取规则由目标网站自身特点决定,对不同站点兼容性较强,具有较高的可扩展性。通过同站点下相似数据的关联和对比,自动实现过滤冗余内容。实现了基于网页结构和基于文本特征抽取的有效结合。
权利要求书 (12项) 说明书 附图

……

……

图1
图2
图3

法律状态时间线

相似专利推荐 AI 驱动 · 同领域

暂无同领域相似专利推荐
议价
不含过户费

📋 交易方式: 委托待转让 📌 交易状态: 在售 👁️ 浏览次数:50 ❤️ 收藏人数:93 📋 项目申报: 未申报

资金托管 权属尽调 包过户
🏢 淄博智来知识产权服务有限公司
✓ 企业认证✓ 手机绑定历史成交 0件好评率 98.5%

📊 出价记录 (3条)
王**¥-10万
李** 企业¥-8万
陈**¥-3万
查看全部出价