AI 红队测试人员还必须了解并测试针对提示词攻击的防御手段。这包括评估输入清洗、输出过滤、指令分隔(如 XML 标签)、上下文感知检查、面向抵抗性的模型微调等措施的有效性,以及对 LLM 能力和工具访问应用最小权限原则。
登录查看节点详情
首阶段节点可试读;登录后解锁全部路线图节点正文与进度同步。