核心 AI Red Teaming 活动之一是生成对抗性示例——输入经过微小扰动以导致错误分类或绕过安全过滤器——以测试模型鲁棒性。Red teamers 使用各种技术(基于梯度、基于优化或黑盒方法)寻找利用模型弱点的输入,为开发者提供加固模型的指导。