【Agentic RL 智能体强化学习】第 46 篇:安全对齐与红队测试 — 让 Agent 安全可靠
本系列定位:从强化学习数学基础出发,系统讲解 LLM 对齐(RLHF/DPO/GRPO)到 Agentic RL(多轮智能体强化学习)的全链路,以 OpenRLHF 框架为实战主线。
本篇你将学到
- 安全对齐的 HHH 原则:Helpful + Harmless + Honest
- 红队测试方法:人工 vs 自动化
- 安全奖励模型设计
- Constitutional AI 在安全对齐中的应用
一、HHH 安全原则
1.1 有用 vs 无害的张力
核心矛盾:越有帮助(什么问题都答),可能越不安全(答了不该答的)。安全对齐的目标是在两者之间找到平衡。
二、红队测试
红队测试(Red Teaming)是系统性地尝试让模型产生有害输出,以发现安全漏洞。
2.1 测试方法
| 方法 | 说明 | 成本 |
|---|---|---|
| 人工红队 | 专业测试员手动攻击 | 💰 高 |
| 自动化红队 | 用另一个 LLM 自动生成攻击 | 💵 低 |
| 对抗提示 | 模板化攻击(越狱 prompt) | 💵 低 |
| 梯度攻击 | 白盒模型梯度搜索 | 中 |
2.2 常见攻击类型
三、安全奖励模型
3.1 独立安全 RM
训练一个独立的"安全分类器"作为额外奖励信号:
defsafety_reward(text,safety_model):"""安全奖励"""safety_score=safety_model.predict(text)# [0, 1], 1=安全ifsafety_score<0.3:return-1.0# 严重惩罚不安全内容elifsafety_score<0.7:return-0.3# 轻度惩罚else:return0.0# 安全,无额外奖惩defcombined_reward(task_reward,safety_reward_val):"""组合任务奖励和安全奖励"""returntask_reward+safety_reward_val3.2 多目标奖励融合
| 奖励维度 | 来源 | 权重 |
|---|---|---|
| 任务完成 | RLVR 或 RM | 1.0 |
| 安全性 | 安全 RM | 2.0(高权重) |
| 有用性 | 偏好 RM | 0.5 |
| 格式 | 规则 | 0.1 |
四、Constitutional AI 应用
第 41 篇学的 Constitutional AI 在安全对齐中特别有效:
- 定义安全宪法原则
- 让 AI 自我批评(“这个回答是否违反了安全原则?”)
- 让 AI 自我修正(“请改写为更安全的版本”)
- 用修正后的数据训练
本篇小结
| 知识点 | 核心内容 |
|---|---|
| HHH 原则 | Helpful + Harmless + Honest |
| 红队测试 | 系统性发现安全漏洞 |
| 安全 RM | 独立的安全分类器作为奖励 |
| 多目标融合 | 任务 + 安全 + 有用性 + 格式 |
| Constitutional AI | 宪法原则 + 自我批评 + 修正 |
下篇预告
第 47 篇:评估体系与基准测试 — 如何衡量 Agent 的进步
如果本篇内容对你有帮助,欢迎点赞收藏!有任何疑问,欢迎在评论区交流。