摘要
本发明揭示了一种基于编辑距离的数据相似度检测方法,该方法包括以下步骤:步骤S1:输入字符串str1,str2;步骤S2:采用动态规划方法获得LD(str1,str2),LCS(str1,str2),LCCS(str1,str2);所述步骤S2包括以下步骤:S21:计算字符串间的编辑距离Ld;S22:计算字符串间的最长公共子序列Lcs;S23:计算字符串间的最长公共子串Lccs;步骤S3:联合Ld,Lcs,Lccs获得字符串相似度sim。该方法可用于大数据数据预处理等领域,利用本发明获得的字符串相似性检测结果更加准确,具有更好的精度和通用性。