核心 GUIDE
Bias & Fairness(偏差与公平性)
Bias / Fairness Engineering 关注 AI System 是否对相关群体或情境产生系统性不同的 Error、Opportunity 或 Burden,以及这些差异是否违反产品 Policy。
核心心智模型
Fairness 不是唯一通用指标,而是围绕具体 Decision 的 Governance Choice:哪些 Outcome 重要、哪些 Group/Slice 相关、什么差异可以接受。
为什么重要
Aggregate Accuracy 可能掩盖集中伤害。系统整体表现很好,但某种 Language、Accessibility Mode 或 Demographic Proxy 可能收到更多 Refusal、更差 Evidence 或更严厉 Decision。把 Fairness 当成 Evaluation Problem,才能与 Human Review、Auditability、Release Gate 真正连接。
01
先定义 Decision、Affected Group 与可接受差异
从 Consequential Outcome 出发,而不是先选一个通用 Bias Score。识别可能被区别对待的 Group 或 Operational Slice,选择与产品 Decision 对应的 Metric,同时查看 Error Rate 与 Downstream Consequence。考虑 Sample Size 与合理任务差异;系统无法解释高后果 Disparity 时,应进入 Human / Governance Review。
02
示例:Average Accuracy 相同,但 False Negative 不均衡
Candidate-screening Helper 更新前后 Overall Score 相同,但 Slice Analysis 发现 Non-standard Career History 的 Applicant 出现更多 False Negative,因为模型过度偏好传统 Chronology。团队 Block Release,调整 Feature 与 Review Policy,并直接测量这个 Disparity,而不是庆祝平均分没有下降。
常见失败模式
- 因为 Aggregate Score 高就宣称 System Fair。
- Fairness Metric 与实际 Product Consequence 没有关联。
- 小 Sample 的大百分比差异被直接当成确定结论。
工程启发
- 围绕具体 Decision 与 Harm Model 定义 Fairness。
- 对关键 Slice 同时报告 Uncertainty 与 Sample-size Context。
- Disparity 涉及高后果风险时设置 Human Review 或 Release Veto。
关键结论
- 01Fairness 是 System-level Evaluation Claim,不是模型形容词。
- 02Aggregate Quality 可能隐藏集中 Failure。
- 03正确 Metric 来自产品 Decision 与 Policy。
阅读记录
这里只记录你真实做过的动作,不代表掌握、熟练或认证。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。