Bias 与 toxicity guardrail 防止 AI agent 给出 unfair 或 harmful 结果。Bias 出现在 training data 偏向某些 group 或 view 时。Toxicity 指 hateful、violent 或 rude 的语言。阻止方法从 clean、balanced data 开始,移除 slur、stereotype 与 spam,并加入多种 voice 的 example 使 model 学习 fair pattern。Training 期间经常 test model,调整偏向一方的 weight 或 rule。Training 后在 output 到达 user 前放置 filter,block toxic word 或 flag unfair answer。保留 log、运行 audit 并请 user feedback 以及早发现新问题。记录每步以便 builder 与 user 了解 limit 与 risk。这些行动保护 people、遵守法律并帮助 user trust AI。