大模型安全 课件 第五章-模型攻击与防御.pptx

大模型安全 课件 第五章-模型攻击与防御.pptx

模型攻击与防御第五章

对抗攻击与防御5.1后门攻击与防御5.2能量延迟攻击5.3提取攻击5.4

对抗攻击与防御5.1

5.1.1对抗攻击的定义Szegedy等人早在2013年便已经敏锐地指出,即便是人类肉眼难以察觉的微小对抗性扰动,也能够显著破坏机器学习模型的推理能力。定义在大模型(如大型语言模型、扩散模型等)的背景下,攻击者通过在模型的推理阶段精心设计和构造微小但是具有针对性的扰动,并将其注入到输入数据中,以欺骗或者误导模型产生不正确、与预期不符的有害输出。对抗攻击旨在利用模型对输入数据微小变化的敏感性来引发模型的不当行为。

对抗攻击的场景和流程攻击者目的5.1.2

文档评论(0)

1亿VIP精品文档

相关文档