AI Red Teaming(AI红队)是指模拟对AI系统发起对抗性攻击,以在恶意行为者行动之前主动识别漏洞、潜在滥用场景和失效模式的一种实践。与传统网络安全红队不同,它专注于AI模型独特的攻击面,例如提示词操纵、数据中毒、模型提取和规避技术。AI Red Teamer(AI红队成员)的主要目标是采用攻击者的思维模式,通过测试AI系统的鲁棒性、安全性、一致性和公平性,特别是像LLM(大型语言模型)这样复杂的系统,以发现隐藏的缺陷并为改进提供可操作的反馈。