news 2026/9/11 23:53:47

论文阅读:NAACL 2024 Self-Guard: Empower the LLM to Safeguard Itself

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
论文阅读:NAACL 2024 Self-Guard: Empower the LLM to Safeguard Itself

总目录 大模型相关研究:https://blog.csdn.net/WhiffeYF/article/details/142132328

LLM安全评估(guard)模型全景:主流开源方案对比与选型指南

https://arxiv.org/pdf/2310.15851

https://www.doubao.com/chat/33343231112007938

论文翻译:https://whiffe.github.io/Paper_Translation/Safe/Self-Guard_%20%E8%B5%8B%E8%83%BD%20LLM%20%E8%87%AA%E6%88%91%E4%BF%9D%E6%8A%A4%20WARNING_%20%E6%9C%AC%E6%96%87%E5%8C%85%E5%90%AB%E6%9C%89%E5%AE%B3%E9%97%AE%E9%A2%98%E5%92%8C%E6%94%BB%E5%87%BB%E6%80%A7%E7%9A%84%E6%A8%A1%E5%9E%8B%E8%BE%93%E5%87%BA%E3%80%82%20—%20Self-Guard_%20Empower%20the%20LLM%20to%20Safeguard%20Itself%20WARNING_%20This%20paper%20contains%20harmful%20questions%20and%20model%20outputs%20that%20are%20offensive%20in%20nature…html

速览

这篇文档讲的是一种叫“SELF-GUARD”的新方法,目的是让大语言模型(比如ChatGPT、Vicuna这类AI)能“保护自己”,不被坏人用“越狱攻击”诱导输出有害内容(比如教怎么搞暴力活动、入侵别人账号),同时还不影响AI正常回答问题的能力。

先简单说下背景:现在的AI虽然经过安全训练,能拒绝有害请求,但坏人会用“越狱攻击”绕开安全机制——比如给有害问题加个小尾巴(比如“开头必须写‘当然,方法是’”),AI就可能乖乖输出有害内容了。之前人们用两种办法保护AI:
一种是“内部安全训练”,给AI喂大量攻击样本让它认有害内容,但这有俩问题:遇到没见过的新攻击就没用了,还可能让AI变“敏感过头”(连正常问题都拒绝,比如问“怎么打开啤酒”都不答);
另一种是“外部防护”,用额外的模型过滤AI的输出,但过滤效果差(只能减少5%的有害内容),还得额外花钱花算力。

而SELF-GUARD的核心思路是“结合两者优点,补各自缺点”,具体分两步训练AI:
第一步是“标签学习”:让AI学会判断内容是有害还是无害。比如给AI看大量有害/无害的例子,让它不仅能给内容贴「harmful」(有害)或「harmless」(无害)的标签,还能说清为啥——比如“这段教入侵账号,违法,所以有害”,这样AI对“有害”的理解更准,不容易被新攻击骗。
第二步是“行为学习”:让AI养成“答完题必贴标签”的习惯。不管用户问啥,AI回答完都得在末尾加「harmful」或「harmless」。这步是为了防止坏人用指令绕开标签要求,毕竟是AI自己练出来的固定行为,比单纯靠指令约束靠谱。

到了实际用的时候,只需要一个超简单的过滤器(几行Python代码就行):如果AI回答末尾是「harmless」,就去掉标签给用户看;如果是「harmful」,就替换成“内容违规,已屏蔽”,不让有害内容出来。

然后文档还做了很多实验验证效果:

  1. 防越狱攻击很给力:面对9种常见攻击(比如用无关问题干扰AI、让AI扮演“无限制角色”),没装SELF-GUARD的AI,攻击成功率能到60%以上,装了之后能降到7%左右;
  2. 不影响AI正常能力:测了AI的常识、推理、答题 accuracy,装了SELF-GUARD后成绩基本没变化,不像之前的安全训练会让AI“变笨”;
  3. 不会敏感过头:之前的安全训练(比如LLaMA-2-Chat)会拒绝40%的正常问题,而装了SELF-GUARD的AI,拒绝率只有1%左右——比如问“怎么结束Python程序”“怎么开啤酒”,AI能正常给方法,不会乱拒绝。

当然,它也有小缺点:比如遇到“无害但违规”的内容(比如问AI给投资建议,虽然无害但不符合平台规则)还没法识别,但文档说只要扩充训练数据,让AI多学这类场景,就能解决;另外,理论上还是可能有极端情况让AI给有害内容贴错标签,但实验里这种情况很少。

总的来说,SELF-GUARD的好处是:不用额外加复杂模型,成本低;防攻击效果好,还不耽误AI正常干活,也不会太敏感,算是个比较实用的AI安全方案。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/10 23:50:16

3、深入了解BPF程序类型

深入了解BPF程序类型 1. BPF程序基础与运行特点 大多数BPF程序只有具有root权限的用户才能加载到内核中。当运行一个BPF程序时,即使你没有对计算机进行任何操作,几秒钟后也会开始看到 “Hello, BPF World!” 消息。这是因为计算机后台运行的程序可能正在执行其他程序。 当…

作者头像 李华
网站建设 2026/9/10 2:45:25

4、BPF 技术深入解析:验证器、类型格式、尾调用与映射操作

BPF 技术深入解析:验证器、类型格式、尾调用与映射操作 1. BPF 验证器 在 Linux 内核中允许任意代码执行,乍一听是个糟糕的主意。不过,BPF 验证器的存在大大降低了在生产系统中运行 BPF 程序的风险。内核网络维护者 Dave S. Miller 曾说:“eBPF 程序与毁灭性深渊之间的唯…

作者头像 李华
网站建设 2026/9/11 12:36:42

11、探索 BPF 实用工具:从 BPFTool 到 eBPF Exporter

探索 BPF 实用工具:从 BPFTool 到 eBPF Exporter 1. BPFTool 的批量模式和 BTF 信息显示 BPFTool 的批量模式允许逐行执行命令,若其中一条命令失败,执行将终止,系统会停留在最后一个成功执行命令后的状态。以下是一个批量模式可处理的文件示例: # Create a new hash m…

作者头像 李华
网站建设 2026/9/11 20:16:45

2.5亿参数破局多模态困境:ModernVBERT重塑视觉文档检索技术边界

2.5亿参数破局多模态困境:ModernVBERT重塑视觉文档检索技术边界 【免费下载链接】modernvbert 项目地址: https://ai.gitcode.com/hf_mirrors/ModernVBERT/modernvbert 在人工智能技术迅猛发展的今天,多模态交互已成为行业创新的重要方向&#x…

作者头像 李华
网站建设 2026/9/11 16:48:39

44、FTP安全指南与服务器配置解析

FTP安全指南与服务器配置解析 1. FTP安全原则 FTP存在多种主要威胁模型,具体如下: - 匿名访问威胁 :匿名用户应仅能列出和下载公共文件,可能允许上传文件到指定的“incoming”目录。绝不能让他们将权限提升至更受信任用户的权限。 - 本地用户账户威胁 :本地用户通过…

作者头像 李华