Prompt injection(也称 jailbreak)是一种 trick,使 AI system 打破自身规则。攻击者在 normal-looking text 中隐藏特殊词或符号。AI 读取此 text 时遵循 hidden instruction 而非 safety rule。攻击者可能迫使 AI 泄露 private data、产生 harmful content 或给出错误建议。当 AI 与其他 software 对话或从 internet 拉取 text 时,此风险增大,因 harmful prompt 可能悄然混入。良好 defense 包括清洗 user input、在 model 内设置 strong guardrail、检查 output 是否违反 policy,以及对 high-risk task 保持 human in the loop。