摘要
本发明公开了基于用户聚类的协同过滤缺失数据处理方法,属于数据处理领域,将有相同属性的多维有缺失的数据集组成的样本形成矩阵,矩阵的行代表数据样本,列代表数据维度,基于用户的协同过滤的基本思想,通过计算样本相对于所有项目的相似度,找到K个相似样本邻居,然后计算K个邻居的相关系数,根据相关系数选择最相似样本的未缺失的项目值作为有缺失数据样本的插补值,填充对应缺失数据的样本的项目值即可。该方法过程较简单,通过将相近样本的非缺失值作为插补值,实现缺失数据的插补,既综合利用了同维度数据样本之间的关系,保证了数据的原有特征,同时又保证数据样本的数量,避免了删除法导致数据量的减少,插补效果相对较好。