摘要
本发明公开了一种基于差分隐私指数机制的模型窃取防御方法和装置,包括:将用户的预测样本输入至通过API调用的目标模型,并对目标模型针对预测样本的原始置信度分布向量添加差分隐私指数机制后作为隐藏置信度分布向量反馈给用户;根据隐藏置信度分布向量得到的预测类标与根据原始置信度分布向量得到的预测类标相同;用户利用隐藏置信度分布向量和预测样本对与目标模型的网络结构相同的窃取网络进行训练以确定第一网络参数,该第一网络参数与目标模型的目标网络参数不同,即由第一网络参数与窃取网络组成的防御模型与由网络结构和目标网络参数组成的目标模型不同,实现了对目标模型窃取的防御。能够提高目标模型的信息安全性。