CodeRoadMap
路线图课程知识库文章题库资源社区我的学习
CodeRoadMap

程序员的学习成长路线图。登录解锁全部课程,并同步路线图与课时进度。

学习

  • 路线图
  • 课程
  • 文章
  • 题库
  • 知识库

更多

  • 资源
  • 社区
  • 我的学习
  • 内容说明

© 2026 CodeRoadMap

津ICP备2026012044号-1·coderoadmap@126.com
开发路线图/AI 智能体开发路线图/偏见与有害内容护栏
阶段一

偏见与有害内容护栏

节点说明与学习资源

Bias 与 toxicity guardrail 防止 AI agent 给出 unfair 或 harmful 结果。Bias 出现在 training data 偏向某些 group 或 view 时。Toxicity 指 hateful、violent 或 rude 的语言。阻止方法从 clean、balanced data 开始,移除 slur、stereotype 与 spam,并加入多种 voice 的 example 使 model 学习 fair pattern。Training 期间经常 test model,调整偏向一方的 weight 或 rule。Training 后在 output 到达 user 前放置 filter,block toxic word 或 flag unfair answer。保留 log、运行 audit 并请 user feedback 以及早发现新问题。记录每步以便 builder 与 user 了解 limit 与 risk。这些行动保护 people、遵守法律并帮助 user trust AI。

← 上一节点数据隐私与 PII 脱敏下一节点 →安全与红队测试