大语言模型提示注入攻击安全风险分析报告-大数据协同安全技术国家工程研究中心(202307).pdfVIP

  • 3
  • 0
  • 约4.86万字
  • 约 52页
  • 2023-07-23 发布于北京
  • 举报

大语言模型提示注入攻击安全风险分析报告-大数据协同安全技术国家工程研究中心(202307).pdf

安全大脑国家新一代人工智能开放创新平台 大语言模型提示注入攻击安全 风险分析报告 大数据协同安全技术国家工程研究中心 2023 年 7 月 6 日 目录 1. 引言 1 2. 提示与提示学习3 2.1 提示的概念 3 2.2 提示学习的概念 6 3. 提示注入攻击7 3.1 直接提示注入 7 3.1.1 目标劫持7 3.1.2 提示泄露9 3.1.3 越狱攻击 11 3.2 间接提示注入 15 4. 提示注入防御 19 4.1 输入侧防御 19 4.1.1 提示过滤 19 4.1.2 提示增强22 4.2 输出侧防御 27 4.2.1 内容审核过滤27 5. 测评数据集构建30 5.1 基础数据集构建 30 5.1.1 越狱攻击验证数据集30 5.1.2 目标劫持验证数据集32 5.1.3 提示泄露验证数据集33 5.2 测评数据集生

文档评论(0)

1亿VIP精品文档

相关文档