一种基于结构与序列协同去冗余的复合物诱饵数据集构建方法,属于生物信息学领域,首先对初始蛋白质复合物结构集合进行筛选,剔除含核酸、小分子或非蛋白质链的条目,并选取符合完整性与分辨率要求的二元复合物;其次,分别基于三维结构相似性与序列同源性进行结构聚类与序列聚类,并对两者结果进行联合比对,剔除在结构与序列上均高度相似的冗余复合物条目;随后,以各聚类代表复合物为目标,利用分子对接或预测建模方法生成多组诱饵结构,计算质量指标;最后,基于质量指标的分数区间进行分层抽样与比例平衡,构建结构与序列协同去冗余且质量分布均衡的高质量蛋白质复合物诱饵数据集。本发明生成的数据集兼具低冗余、高多样性与质量分布可控性。
📄 2026100989276
📂 G16B40_30
👤 浙江工业大学
📅 2026-01-26
本发明属于DNA数字存储与生物信息学交叉领域,公开了一种基于混合专家模型的DNA测序读段重构方法及系统,对原始DNA测序读段进行聚类,将聚类后的读段通过核苷酸‑颜色映射转换为图像形式,并进行长度归一化和聚类大小调整,得到标准化的3通道图像;将标准化的3通道图像输入至DNAMoE模型,得到初始重建结果,若初始重建结果的置信度低于设定阈值,利用置信度过滤器对低置信度区域进行多数投票生成更新图像;将更新图像替换输入图像中偏差最大的读段对应的列后重新输入DNAMoE模型迭代优化,直至置信度达标或达到最大迭代次数,输出最终重建结果。
📄 2025112267331
📂 G16B40_30
👤 广州大学
📅 2025-08-29