AI Red Teamers 执行模型反演测试,以评估攻击者是否可以通过反复查询模型并分析其输出来重建敏感训练数据(如图像、文本片段或个人属性)。成功表明存在因数据记忆导致的隐私风险,需要采用差分隐私或输出过滤等缓解技术。