本发明涉及细胞数据分析技术领域,公开了一种基于多模态语言模型的单细胞转录组数据与文本描述联合分析方法,包括:获取单细胞RNA测序表达矩阵与对应的细胞文本描述,对单细胞RNA测序表达矩阵与对应的细胞文本描述进行预处理,构建多模态数据集,通过构建双模型与跨模态投射模块,实现了基因表达数据与文本知识的深度融合,避免了单一模态的局限,预处理时保留基因表达值与索引序列,改变了粗糙编码方式,提升了细胞类型识别准确率,基于对比学习、匹配学习及跨模态投射模块的预训练策略,实现了细粒度的跨模态信息交互与共享,优化了文本生成细胞或细胞生成文本等跨模态任务效果。
📄 2025109581450
📂 G16B30_00
👤 龙岩学院
📅 2025-07-11
本申请涉及一种基因编辑效率检测方法、基因编辑效率检测装置和电子设备。该基因编辑效率检测方法包括:通过基于引物和扩增子的匹配对所述待检测基因编辑数据进行数据拆分;对拆分后的数据进行基于动态最小重叠下限的双端读段合并;对合并后的数据进行重复标记;基于局部比对对重复标记后的数据和未进行双端读段合并的数据进行比对,和对局部对比结果进行全局重比对;基于局部对比结果和全局重比对结果进行编辑事件识别和序列过滤;以及,基于过滤后的合格序列计算基因编辑效率。这样,可以在保持基因编辑效率检测准确性的同时提高基因编辑效率的检测效率。
📄 2021112767137
📂 G16B30_00
👤 博雅缉因(北京)生物科技有限公司
📅 2021-10-29
本发明公开冷链一种基于多示例学习的IRES序列搜寻方法。本发明以经过实验验证过的含IRES的序列为正样本,未含IRES的序列为负样本,以多示例学习为框架,通过对正负样本组成的数据集进行训练,获得一个有效的IRES预测估计模型。本发明可以快速高效的判断细胞mRNA中是否存在IRES序列以及存在的大致位置。本发明针对mRNA中IRES序列验证的生物实验较为复杂且人力、物力成本消耗过高的问题。本发明可以对mRNA序列是否存在IRES序列进行快速判断,并预估其大概所在位置,从而可使相关科研工作者优先对大概率存在IRES序列的mRNA片段进行生物实验验证,以提高工作效率,减少工作强度。
📄 201910548286X
📂 G16B30_00
👤 杭州电子科技大学
📅 2019-06-24
一种双向三核苷酸位置特异性偏好和点联合互信息DNA/RNA序列编码方法,由建立DNA/RNA序列核苷酸位置特异性偏好矩阵、建立DNA/RNA序列双向二核苷酸位置特异性偏好矩阵、建立DNA/RNA序列双向三核苷酸位置特异性偏好矩阵、确定DNA/RNA序列核苷酸的点联合互信息值、特征组合、DNA/RNA序列样本编码步骤组成。为了从DNA/RNA序列数据中提取更多三核苷酸的位置信息,引入参数β表示当前核苷酸与其前向或后向连续二核苷酸之间的距离,将β不同取值的数值特征向量组合为全局高维数值特征向量,在用于DNA的4mC甲基化位点和RNA的m6A甲基化位点识别中具有非常好的性能。本发明得到的DNA/RNA数值特征数据具有分类信息多、特征间冗余度低、训练的模型识别准确率高等优点,可用于DNA/RNA序列的编码。
📄 2020112361082
📂 G16B30_00
👤 陕西师范大学
📅 2020-11-09
本发明属于高阶SNP上位交互检测技术领域,公开了一种基于生成对抗网络的SNP上位交互识别方法、系统及应用,对抗网络,输入SNP上位模型的参数,输出是SNP组合的样本矩阵,根据SNP上位模型参数产生样本数据集;生成对抗网络对SNP上位模型进行统一的训练,识别器判别输入的SNP组合是否具有上位效应,正确输出上位效应所属的上位模型类型。本发明不同于传统的机器学习方法利用神经网络学习K‑order SNP上位交互模型。本发明可以用于从全基因组中快速识别SNP上位交互组合的方法,识别准确率高,对上位模型的没有偏好性,并且可以正确识别多种不同种类的SNP上位交互组合的模型类型,为生物科学家提供理论依据。
📄 2020113959888
📂 G16B30_00
👤 西安邮电大学
📅 2020-12-03
本发明提出一种基于细胞动态分化的基因调控网络构建方法,该方法包括,获取单细胞转录组测序数据并进行预处理,再利用Slingshot进行推断,得到包含细胞注释信息和拟时间信息的表达矩阵;根据表达矩阵中拟时间信息的密度计算两种细胞状态之间的交点,以交点为基准,将所有细胞划分成多个窗口;在每个窗口中构建细胞类型特异性基因调控网络;构建参考网络,将参考网络作为参考信息来校准细胞类型特异性基因调控网络。本发明将拟时间信息和细胞类型结合,并且考虑了细胞密度沿拟时间的分布状况,有助于从细胞动态分化的角度构建细胞类型特异性的基因调控网络,使得所构建的基因调控网络更准确。
📄 2023107651801
📂 G16B30_00
👤 华东交通大学
📅 2023-06-27
本发明公开了一种基于序列‑结构双通道神经网络的抗菌肽识别方法及系统,该方法将ProtT5提取的氨基酸特征和氨基酸级手工特征进行拼接,得到肽的嵌入并传入到多个Transformer块组成的序列通道来提取肽的序列特征;利用ESM‑Fold预测肽的三维结构来构建邻接图,将ESM‑2获取的氨基酸特征作为邻接图的节点特征,通过融合多头图注意力、残差网络、层归一化和前馈神经网络的结构通道进行逐层提取与增强;对序列特征和结构特征进行最大池化和拼接,然后用于抗菌肽预测。本发明采用多特征融合策略,同时通过引入抗菌肽的三维结构信息,利用双通道架构融合序列和结构特征,有效提高了抗菌肽识别的准确性。
📄 2025109380714
📂 G16B30_00
👤 华东交通大学
📅 2025-07-08
一种基于角度特征的短时序基因表达数据聚类方法,包括以下步骤:步骤1,计算角度特征;步骤2,用Affinity Propagation聚类算法聚类;步骤3,获得功能显著的类;把基因表达变化趋势相似的基因聚为一类,同属于一类的基因有功能相似的趋势;对于每一个基因,相邻时间点的基因表达的变化可以计算出角度特征,反映基因表达的局部变化趋势;对于每个时间点,用换算后的角度间接反映整体的表达水平情况;以这些角度为特征,皮尔森相关系数作为相似性测度,相关系数越大,表示两个基因的表达谱越相似;然后用Affinity Propagation聚类算法聚类;具有聚类结果更能反映基因功能、聚类结果做功能富集分析的p值更小的特点。
📄 2020100604295
📂 G16B30_00
👤 西安理工大学
📅 2020-01-19
本发明公开了基于单分子测序的发酵金鲳深度学习质量判别方法及系统,涉及发酵水产食品快速分析检测领域,通过制备不同品质等级的传统发酵金鲳粉末状样品;提取样品的宏基因组DNA,并检验片段完整度、纯度及浓度;通过获取发酵金鲳样品的物种丰度数据,并作为神经网络模型的训练样本数据,对神经网络模型进行训练,并使用训练好的神经网络模型,对不同传统发酵金鲳的品质等级进行判别;本发明解决了标准化程度低和产品品质不稳定等问题,利用单分子实时测序获得样品的微生物群落结构组成,并结合机器学习判断传统发酵金鲳的品质质量等级,具有准确性高的特点,有利于传统发酵金鲳的品质监测和工业化生产。
📄 2021115783752
📂 G16B30_00
👤 中国水产科学研究院南海水产研究所; 北部湾大学
📅 2021-12-22
本发明公开了一种基于调制技术的多级目录DNA存储编解码方法,其包括如下步骤:S100:生成引物序列和文件数据序列的调制码表,构建引物序列数据集和文件绝对路径集;S200:将待存储二进制文件调制成DNA序列,合成后进行体外存储;S300:选择目标引物,从合成池中扩增出目标逻辑磁盘下的DNA分子并测序;S400:对测序数据的每个读长根据观测调制序列,计算其文件绝对路径并以此对测序数据进行分组;S500:根据编码DNA链长度及文件绝对路径,生成用于解码各分组数据的调制序列;并用此调制序列按照调制DNA存储解码算法解码数据。本发明基于调制技术设计寻址序列,提出多级目录DNA存储编解码方法,可实现高效、灵活的DNA存储文件管理方式。
📄 2023101734143
📂 G16B30_00
👤 广州大学
📅 2023-02-27
本发明公开了外泌体circRNAs诊断早期肺腺癌的效率评估方法,涉及医疗诊断技术领域,该方法包括:S1、收集早期肺腺癌患者与健康志愿者的血清外泌体,并在外泌体circRNA转录组测序后,随机划分为训练队列与验证队列;S2、基于支持向量机递归特征消除、套索‑逻辑回归以及受试者操作特征曲线,从训练队列中筛选早期肺腺癌的分子标签;S3、基于分子标签的表达矩阵,建立评分体系,评估早期肺腺癌的诊断效率,并展示训练队列中样本的风险分布;S4、基于曲线下面积模型及决策曲线,在验证队列中,论证分子标签的诊断效率。本发明为早期干预和治疗提供了科学依据,为个体化医疗和精准诊疗奠定了基础。
📄 202410109270X
📂 G16B30_00
👤 南通大学附属医院
📅 2024-01-26
本发明公开了一种基于多重进化矩阵的蛋白质二级结构预测方法,包括:下载蛋白质NR数据库及BLAST程序本地软件包,生成给定蛋白质序列的位置特异性打分矩阵PSSM矩阵,对PSI‑BLAST程序进行参数调整得到蛋白质序列的不同趋异度的进化矩阵;对进化矩阵中的所有特征向量进行处理,构成多重进化矩阵特征;将多重进化矩阵的特征作为分类器的输入并对分类准确率进行评价,获得优化模型;针对结构未知的蛋白质,输入优化模型,预测蛋白质的二级结构。本发明对于一条蛋白质序列,同时使用多种不同进化趋异度的矩阵来表示蛋白质序列,更为充分的表示了蛋白质结构信息,更全面的考虑了残基替换的可能性,提高了蛋白质二级结构预测的准确率,编码方法简单有效。
📄 2017101504184
📂 G16B30_00
👤 齐鲁工业大学
📅 2017-03-14