直接注入攻击是指与 LLM 交互的用户直接在提示词输入框中插入恶意指令。AI 红队测试人员用这种技术评估诸如"忽略之前的提示词"这类简单指令能否立即破坏模型的安全性或预期功能,从而检验系统提示词约束力的鲁棒性。
登录查看节点详情
首阶段节点可试读;登录后解锁全部路线图节点正文与进度同步。