核心 GUIDE

RISKINTERMEDIATE7 分钟阅读

Bias & Fairness(偏差与公平性)

Bias / Fairness Engineering 关注 AI System 是否对相关群体或情境产生系统性不同的 Error、Opportunity 或 Burden,以及这些差异是否违反产品 Policy。

核心心智模型

Fairness 不是唯一通用指标,而是围绕具体 Decision 的 Governance Choice:哪些 Outcome 重要、哪些 Group/Slice 相关、什么差异可以接受。

为什么重要

Aggregate Accuracy 可能掩盖集中伤害。系统整体表现很好,但某种 Language、Accessibility Mode 或 Demographic Proxy 可能收到更多 Refusal、更差 Evidence 或更严厉 Decision。把 Fairness 当成 Evaluation Problem,才能与 Human Review、Auditability、Release Gate 真正连接。

01

先定义 Decision、Affected Group 与可接受差异

从 Consequential Outcome 出发,而不是先选一个通用 Bias Score。识别可能被区别对待的 Group 或 Operational Slice,选择与产品 Decision 对应的 Metric,同时查看 Error Rate 与 Downstream Consequence。考虑 Sample Size 与合理任务差异;系统无法解释高后果 Disparity 时,应进入 Human / Governance Review。

02

示例:Average Accuracy 相同,但 False Negative 不均衡

Candidate-screening Helper 更新前后 Overall Score 相同,但 Slice Analysis 发现 Non-standard Career History 的 Applicant 出现更多 False Negative,因为模型过度偏好传统 Chronology。团队 Block Release,调整 Feature 与 Review Policy,并直接测量这个 Disparity,而不是庆祝平均分没有下降。

常见失败模式

  • 因为 Aggregate Score 高就宣称 System Fair。
  • Fairness Metric 与实际 Product Consequence 没有关联。
  • 小 Sample 的大百分比差异被直接当成确定结论。

工程启发

  • 围绕具体 Decision 与 Harm Model 定义 Fairness。
  • 对关键 Slice 同时报告 Uncertainty 与 Sample-size Context。
  • Disparity 涉及高后果风险时设置 Human Review 或 Release Veto。

关键结论

  1. 01Fairness 是 System-level Evaluation Claim,不是模型形容词。
  2. 02Aggregate Quality 可能隐藏集中 Failure。
  3. 03正确 Metric 来自产品 Decision 与 Policy。

阅读记录

未打开Practice 尚未完成

这里只记录你真实做过的动作,不代表掌握、熟练或认证。

用于这些学习路径

这个 Concept 会在多个 canonical 学习路径中复用。