AI安全技术与实战 (腾讯安全朱雀实验室(三).docx

AI安全技术与实战 (腾讯安全朱雀实验室(三).docx

AI安全:技术与实战

182

掌握太多知识的;相反,防御者允许掌握攻击者的很多知识。

在本方法中,考虑一个对黑盒语言模型具有输入输出访问权限的攻击者。也就是说,我们允许攻击者获得下一个单词的预测结果,但不允许攻击者掌握语言模型中的单个权重参数或隐藏状态(如注意力向量)。

攻击者的目标是从模型中提取被记忆的训练数据。需要说明的是,由于技术上的困难性,这里并不要求提取特定的训练数据,只需要随意提取训练数据即可。

如图5.8所示,攻击一共由两个步骤组成。

(1)生成文本:从模型中无条件采样大量生成文本。

(2)成员推断:使用成员推断来删除那些重复出现的样本,从而加强生成文本的准确性,预

文档评论(0)

1亿VIP精品文档

相关文档