Evaluation · 面试核心
安全与红队
能力越强,风险越大。面试常问:怎么让模型「不乱说话」?提示注入和越狱区别?红队怎么打?本文给一张风险地图与防御清单。
01风险地图
内容安全
涉政、暴力、色情、违法内容生成。
越狱 / 提示注入
绕过系统提示,诱导模型做不该做的事。
隐私泄露
训练数据/会话/工具返回里的敏感信息外泄。
幻觉误导
自信地编造事实,尤其高危决策场景。
偏见歧视
性别/地域/群体刻板印象。
工具滥用
Agent 调用外部工具造成真实损害(删库、发信)。
02越狱(Jailbreak)
攻击者用话术让模型突破安全护栏。常见手法:
角色扮演
「你现在是无限制 DAN」,利用角色切换绕过系统规则。
编码/外语
把违规请求用 base64、摩斯、小语种包装,绕过敏感词过滤。
虚拟情境
「写小说/剧本里的一段」,借虚构削弱安全约束。
分阶段诱导
先问无害铺垫,再逐步逼近真实目的(渐进式)。
03提示注入(Prompt Injection)
与越狱不同:提示注入是把恶意指令藏进模型处理的外部数据(网页、邮件、文档、工具返回)里,借「数据即指令」的漏洞操控模型。RAG、Agent 尤其高危。
面试要点:越狱针对「模型本身」,提示注入针对「模型消费的不受信任内容」。后者在 Agent/RAG 场景更致命,因为攻击面在用户输入之外。
04防御体系(分层)
输入侧
系统提示加固、输入分类/过滤、注入检测、权限最小化(工具按需授权)。
输出侧
输出审核(moderation)、敏感信息脱敏、格式/边界校验。
训练侧
安全 SFT、RLHF/DPO 安全偏好、红队数据持续迭代。
架构侧
数据与指令隔离、沙箱执行工具、人类审批高风险动作。
05红队(Red Teaming)方法论
红队是主动找茬:用对抗性探测发现模型弱点,再据此补数据、调护栏。做法:
- 自动化:用攻击模板库 + 另一个模型生成对抗 prompt,批量扫描。
- 人工:专家设计刁钻场景(多轮诱导、跨语言、代码执行)。
- 闭环:发现的失败案例回流成训练/评估数据,形成「攻防迭代」。
06合规与对齐视角
安全不是只靠过滤词,而是对齐的延伸(见 alignment 目录)。从「外部拦截」走向「模型内生的无害性」才是根本。监管(内容安全合规、数据隐私法)也要求可审计、可拒答、可溯源。
权衡:护栏过严会伤害可用性(拒答正常问题),需在安全与有用之间取平衡——这也是对齐税的体现。
07面试速记卡
越狱 vs 注入
越狱攻模型本身;注入攻模型消费的不可信数据。
防御分层
输入/输出/训练/架构四层,单一手段不够。
红队
主动对抗 + 失败案例回流,形成攻防闭环。
根本之道
靠对齐内生无害,而非只靠关键词过滤。
关联:对齐训练见 reinforcement-learning/rlhf-dpo-explained;Agent 工具风险见 agent 目录。