Safety + Red Team Testing 是在发布前后检查 AI agent 是否有 harmful 或 risky behavior 的做法。Safety work 设定 rule、guardrail 与 alarm,使 agent 遵守法律、保护 data privacy 并 fair 对待 people。Red team testing 派 skilled tester 扮演 attacker 或 troublemaker,输入 tricky prompt、尝试 leak private data、迫使 biased output 或使 agent 给出 dangerous advice。发现的每个 weakness 被记录并通过添加 filter、better training data、stronger limit 或 live monitoring 修复。经常运行这些 test 可降低 real-world harm 概率并建立 user 与 regulator 的 trust。