越狱是提示词攻击的一个特定类别,AI 红队测试人员的目标是绕过 LLM 的安全与对齐训练。他们常用的技巧包括虚构场景、要求模型模拟一个不受限制的 AI,或通过复杂指令诱骗模型生成违反自身政策的内容(例如生成有害代码、仇恨言论或非法指令)。
登录查看节点详情
首阶段节点可试读;登录后解锁全部路线图节点正文与进度同步。