本发明公开了一种基于容错编码及多尺度密集连接网络的转录因子结合位点预测方法及系统,包括:在特征表示阶段引入容错机制,将原始DNA序列和其二阶容错序列结合并转换为特征向量;构建基于多尺度密集连接的深度神经网络;将全局数据集输入基于多尺度密集连接的深度神经网络进行预训练;基于预训练模型与各个子数据集,进一步对深度神经网络进行迁移学习;将待预测DNA序列输入迁移训练后的深度神经网络,输出对应的DNA序列结合转录因子的概率,本发明利用容错编码丰富DNA序列的特征,密集连接网络提取了序列的高阶特征,多尺度卷积进一步捕获不同尺度的特征,三者结合使得深度神经网络的预测精度和收敛速度得到提升。
📄 2022102498143
📂 G16B20_30
👤 江苏科技大学
📅 2022-03-14
本发明涉及一种基于跨平台基因表达数据的基因调控网络重建方法,根据跨平台基因表达数据的特点,通过获取来自p个测序平台基因表达数据,并进行预处理,然后从每个基因样本中抽取n个基因表达量,并基于偏相关系数的混合型条件独立性测试得到每个基因表达量的父子节点集,将其应用于跨平台因果网络结构学习的学习网络骨架、确定v‑结构和最大化标志方向三个过程中,从而重建出跨平台基因调控网络,本发明利用因果图模型解决跨平台基因调控网络的问题,能直接有效地利用跨平台基因表达数据进行高维的基因调控网络重建的同时,避免数据预处理过程导致的数据过度平滑等问题,提高了跨平台基因调控网络重建结果的正确率和召回率。
📄 2017102017975
📂 G16B25_10
👤 广东工业大学
📅 2017-03-30
一种基于集成学习的细胞类型自动分类方法,该集成学习算法使用bagging的方式集成了各种在单细胞测序领域性能较好的机器学习算法,如支持向量机(SVM),逻辑回归(LR)、随机森林(RF)等,使用投票的方式决定最终的预测细胞类型。使用该集成学习方法在多个不同类型的单细胞RNA测序数据集上进行细胞分类的性能比较,将取得更好的分类性能,以体现该集成学习方法的泛化性及优越性。
📄 2022105708336
📂 G16B40_20
👤 南京邮电大学
📅 2022-05-24
一种基于序列特征的植物长链非编码RNA预测方法,包括正负数据集构建去冗余、序列k‑mer频率特征提取、特征融合与选择以及分类器对比,正负数据集的构建去冗余旨在消除序列相似性对预测结果造成的影响,序列特征提取实现了对基因序列k‑mer特征的提取,特征融合在序列k‑mer特征提取的基础上加入序列长度特征和序列GC含量特征后将这三类特征进行融合,接着使用卡方检验进行最优特征选择,最后运用梯度提升决策树算法解决植物lncRNA的识别分类问题。本发明深入挖掘了基因序列特征,有效的融合这些特征且加以选择,为如何从大量的转录本中准确地识别出植物lncRNA这一问题提供了可行的方法。
📄 2022105708285
📂 G16B40_20
👤 南京邮电大学
📅 2022-05-24
本发明属于基因序列比对技术领域,具体涉及一种单倍型感知的序列到图比对方法、系统、装置、介质,该方法将单倍型信息直接嵌入到泛基因组图的边关联结构中,使图结构本身具备表达单倍型路径的能力。然后采用改进的单倍型感知偏序比对算法将序列映射到该图上,使其能够识别并利用嵌入的单倍型信息,确保比对结果的全局一致性。最后采用基于全局缓存的路径复用回溯得到最优比对路径,在保证精度的同时显著提升算法效率。
📄 2026103954616
📂 G16B30_10
👤 烟台大学
📅 2026-03-30
本发明涉及细胞数据分析技术领域,公开了一种基于多模态语言模型的单细胞转录组数据与文本描述联合分析方法,包括:获取单细胞RNA测序表达矩阵与对应的细胞文本描述,对单细胞RNA测序表达矩阵与对应的细胞文本描述进行预处理,构建多模态数据集,通过构建双模型与跨模态投射模块,实现了基因表达数据与文本知识的深度融合,避免了单一模态的局限,预处理时保留基因表达值与索引序列,改变了粗糙编码方式,提升了细胞类型识别准确率,基于对比学习、匹配学习及跨模态投射模块的预训练策略,实现了细粒度的跨模态信息交互与共享,优化了文本生成细胞或细胞生成文本等跨模态任务效果。
📄 2025109581450
📂 G16B30_00
👤 龙岩学院
📅 2025-07-11
本发明涉及交互融合特征表示与选择性集成的DNA结合蛋白识别方法。相比于现有的方法,本发明的方法具有更加卓越的性能,这也间接表明本发明的交互融合特征表示能够生成携带有强判别信息的特征,同时选择性集成还能进一步提升整体学习器的泛化能力,最终能够保证对DNA结合蛋白的准确预测。
📄 2017107313091
📂 G16B30_10
👤 福建众维智汇科技有限公司
📅 2017-08-23
本发明涉及基因变异检测技术领域,具体属于一种基于稳健统计与多策略融合的基因序列变异检测方法,包括:比对生成一个已排序的BAM文件;对数据中的缺失值和N位置进行预处理,采用0填充策略替换缺失值,并移除N位置数据;提取RD信号和MQ信号作为特征值;对提取到的RD信号进行GC偏差矫正;对RD信号和MQ信号进行平滑降噪处理;采取两步递进式分割策略,识别具有高度一致性的RD值的连续片段;构建RD信号和MQ信号的二维剖面,并进行标准化处理;串联重复检测并计算异常分数;利用箱线图方法设置阈值,判定异常值;细化串联重复区域。本发明有效解决了低覆盖度测序数据下串联重复变异检测的难题,显著提高了检测的准确性和可靠性。
📄 2025103631916
📂 G16B20_20
👤 聊城大学
📅 2025-03-26
一种基于深度卷积网络的ATP绑定残基预测方法,根据输入待进行ATP绑定残基预测的蛋白质序列信息P,其残基个数为L,使用HHblits程序获取包含M条序列的多序列联配信息;计算这M条序列的对应位置与20种残基对应位置出现相同类型的频率,得到位置特异性频率矩阵;采用滑动窗口技术对位置特异性频率矩阵中的每个残基进行特征视图处理,并将这些特征视图扩展为特征张量;搭建深度卷积网络并利用已知ATP绑定残基的蛋白质序列生成对应的特征张量对该网络进行训练;将待预测的蛋白质序列生成的特征张量输入到训练好的深度卷积网络模型中,预测蛋白质序列中的残基是否为ATP绑定残基。本发明计算代价小、预测精度高。
📄 2020112628905
📂 G16B15_20
👤 浙江工业大学
📅 2020-11-12
一种基于共表达网络的癌症靶向标志物测绘方法,包括以下步骤:1)构建共表达基础网络,根据特征基因的基因表达数据计算邻接矩阵与拓扑矩阵;2)提取共表达基础网络的特征,即将拓扑网络的各个基因节点转换为特征向量作为网络的特征值;3)训练神经网络模型,根据游走序列,进行神经网络模型参数的训练;4)进行癌症靶向标志物测绘,根据基于密度峰的聚类中心自适应算法进行靶向基因社区的自动发现。本发明提供一种具有良好的普适性和精度,采用共表达基础网络构建和节点特征向量提取以及基因社区自动发现实现目标基因测绘的方法。
📄 2017113365591
📂 G16B15_30
👤 浙江工业大学
📅 2017-12-14
一种基于残基距离和接触信息的蛋白质结构预测方法,在Rosetta的基本框架下,引入表示空间中各个位置上残基的相互距离的距离谱和残基接触信息来提高能量函数的精度。首先初始化构象,用Rosetta第一阶段的片段组装技术生成初始种群,并在初始种群中分别对每个构象用Rosetta第二阶段的片段组装来生成新构象;然后根据设计的残基距离谱和接触信息能量函数来指导构象选择,从而更新种群;最后,按上述步骤分别进行Rosetta第三阶段和第四阶段,从而得到最终预测结果。通过残基距离和接触信息为辅来指导构象选择,从而缓解能量函数不精确导致的预测误差问题。本发明预测精度较高。
📄 2018106317066
📂 G16C20_70
👤 浙江工业大学
📅 2018-06-19
一种基于域间残基接触的多域蛋白结构组装方法,从各结构域的三维结构出发,利用结构比对工具对蛋白质库中所有的多域蛋白模板进行打分,并选择得分最高的模板进行组装;然后根据模板生成初始结构,并随机选择一个较小的区域进行刚体旋转和平移,从而生成新的全长结构;其次,根据域间残基接触、模板和域间原子冲突能量来评价组装结构的质量,并根据蒙特卡洛准则接受组装结构;最后,选择所有模板组装得到的结构中能量最低的结构为最终结构。本发明提供一种预测精度较高的基于域间残基接触的多域蛋白结构组装方法。
📄 2019103169067
📂 G16B25_10
👤 浙江工业大学
📅 2019-04-19