摘要
一种基于结构与序列协同去冗余的复合物诱饵数据集构建方法,属于生物信息学领域,首先对初始蛋白质复合物结构集合进行筛选,剔除含核酸、小分子或非蛋白质链的条目,并选取符合完整性与分辨率要求的二元复合物;其次,分别基于三维结构相似性与序列同源性进行结构聚类与序列聚类,并对两者结果进行联合比对,剔除在结构与序列上均高度相似的冗余复合物条目;随后,以各聚类代表复合物为目标,利用分子对接或预测建模方法生成多组诱饵结构,计算质量指标;最后,基于质量指标的分数区间进行分层抽样与比例平衡,构建结构与序列协同去冗余且质量分布均衡的高质量蛋白质复合物诱饵数据集。本发明生成的数据集兼具低冗余、高多样性与质量分布可控性。