首页
/ ML-For-Beginners 责任 AI 实战指南:机器学习中的公平性、安全、透明与问责原则

ML-For-Beginners 责任 AI 实战指南:机器学习中的公平性、安全、透明与问责原则

2026-09-06 13:36:57作者:范靓好Udolf

本文基于 ML-For-Beginners 课程 1-Introduction 第 3 课(Fairness)整理成文,系统讲解"用负责任的 AI(Responsible AI)构建机器学习系统"这一主题:从公平性的五类典型危害,到可靠安全、包容性、安全与隐私、透明、问责六大核心原则,再到训练前的影响评估(Impact Assessment)与基于责任 AI 的模型调试方法。读完后你将能够:识别数据与模型中潜在的公平性危害、在建模前完成影响评估、并理解 RAI(Responsible AI)仪表盘四大调试组件的原理与适用场景。

机器学习中的公平性主题手绘摘要图

引言:机器学习已经在替我们做决策

当前,机器学习系统已经深度介入日常决策任务:医疗诊断、贷款审批、欺诈检测等。正如课程原文(1-Introduction/3-fairness/README.md)所述,任何软件应用都可能达不到预期或产生不良结果,AI 系统也不例外。因此,理解并能解释一个 AI 模型的行为至关重要。

课程引导读者思考一系列关键问题:

  • 如果训练数据缺少某些人群(种族、性别、政治观点、宗教等)的样本,或对这些人群表示失衡,会发生什么?
  • 如果模型输出被解读为偏向某个人群,对应用意味着什么?
  • 当模型产生伤害性结果时,谁来为 AI 系统的行为负责?

本节的课程目标对应六个方面:认识公平性及其相关危害、熟悉通过探索异常值与非典型场景来保证可靠与安全、理解设计包容性系统以赋能每个人、认识保护数据与个人隐私安全的必要性、理解"玻璃箱"(glass box)式可解释方法对说明 AI 行为的价值、以及意识到问责对建立 AI 系统信任的不可或缺。

前置要求:课程建议先完成 "Responsible AI Principles"(责任 AI 原则)学习路径并观看相关主题视频,再进入本节学习。

公平性:AI 系统应当公平地对待每个人

AI 系统应当公平地对待所有人,避免以不同方式影响相似的人群。例如,当 AI 系统就医疗治疗、贷款申请或雇佣提供建议时,对于症状相似、财务状况相似或专业资质相似的个体,应当给出相同的推荐。每个人作为人类都携带着与生俱来的偏见,影响着决策与行为;这些偏见可能显化在用于训练 AI 系统的数据中,而这种操纵有时是无意识发生的——往往很难在主观上察觉自己正在向数据中引入偏见。

**"不公平"(Unfairness)**涵盖对一个人群(例如按种族、性别、年龄或残障状态界定的人群)的负面影响,即"危害"(harms)。与公平性相关的主要危害可归纳为以下五类:

危害类型 含义 典型案例
分配(Allocation) 某个性别或种族群体被优先于另一群体 资源分配中偏向特定人群
服务质量(Quality of service) 用单一特定场景训练数据,而现实更复杂,导致服务表现差 自动皂液器无法感应深色皮肤人群
诋毁(Denigration) 不公正地批评或给某人/某物贴标签 图像分类技术曾将深色皮肤人物误标为"大猩猩"
过度或欠代表(Over/under-representation) 某类人群在某个职业中"不可见",持续强化此现象的服务都在造成危害 招聘广告模型偏向某性别受众
刻板印象(Stereotyping) 将特定群体与预设属性关联 英土翻译系统中因性别刻板词汇导致翻译错误

其中"刻板印象"一类的课程示例值得展开:英文 "He's a nurse. She's a doctor." 翻译成土耳其语时,由于土耳其语缺少性别代词,被合并译为 "O bir hemşire. O bir doktor."(他/她是护士。他/她是医生。),丧失了原文的性别指代信息——这正是"把群体与预设属性关联"在语言技术中的体现。下图即课程中展示的这一翻译示例:

英文翻译成土耳其语的性别偏见示例

课程强调:在设计(design)和测试(test)AI 系统时,必须确保 AI 是公平的,没有被编程去做出有偏见或歧视性的决策——这些决策人类同样被禁止做出。保证 AI 与机器学习中的公平性,仍然是一个复杂的社会技术(sociotechnical)挑战。

其他五大责任 AI 原则

除公平性外,课程围绕"责任 AI 六大原则"逐一展开,每一原则都是构建可信 AI 系统时不可省略的维度。

可靠与安全(Reliability and safety)

要建立信任,AI 系统需要在正常与异常条件下都保持可靠、安全、一致。关键在于了解 AI 系统在各种情境下的行为,尤其是面对异常值(outliers)时。构建 AI 解决方案时,需要大量关注它将要遇到的各种环境条件。课程给出的经典例子是自动驾驶汽车:它必须把人的安全放在最高优先级,因此驱动汽车的 AI 需要考虑所有可能遇到的场景——黑夜、雷雨或暴风雪、跑过马路的儿童、宠物、道路施工等。AI 系统处理广阔条件范围的能力,反映了数据科学家或 AI 开发者在设计或测试系统时所做预判的完备程度。

包容性(Inclusiveness)

AI 系统应当被设计得能够接触并赋能每个人。在设计并实现 AI 系统时,数据科学家与 AI 开发者需要识别并处理系统中可能无意中排除某些人的障碍。课程指出,全球约有 10 亿人患有残障;随着 AI 的进步,他们可以在日常生活中更便捷地获取广泛的信息与机会。处理这些障碍,会创造出创新机会,开发出体验更好、惠及所有人的 AI 产品。

安全与隐私(Security and privacy)

AI 系统应当安全并尊重个人隐私。对于会危及隐私、信息甚至生命的系统,人们的信任度更低。训练机器学习模型依赖数据来获得最佳结果,在此过程中必须考虑数据的来源与完整性——例如:数据是用户提交的还是公开可获取的?在处理数据时,关键在于开发能够保护机密信息并抵抗攻击的 AI 系统。

课程列举了该领域的几个关键事实判断:

  • 行业在隐私与安全方面取得了重大进展,很大程度上由 GDPR(通用数据保护条例)等法规推动;
  • 但在 AI 系统中必须承认一个张力:需要更多个人数据来让系统更个性化、更有效——与隐私之间的张力;
  • 就像互联计算机诞生时一样,我们也看到与 AI 相关的安全问题数量大幅上升;
  • 同时,AI 也被用于改进安全,例如如今大多数现代反病毒扫描器都由 AI 启发式(heuristics)驱动;
  • 必须确保数据科学流程与最新的隐私和安全实践协调一致。

隐私与数据安全之所以对 AI 需要格外关注,是因为:访问数据是 AI 系统对个人做出准确、知情预测与决策的前提。

透明(Transparency)

AI 系统应当是可理解的。透明的核心部分是解释 AI 系统及其组件的行为。改进对 AI 系统的理解,需要利益相关者(stakeholders)理解系统如何以及为何运作,以便他们能识别潜在的性能问题、安全与隐私隐患、偏见、排他性做法或意外后果。使用 AI 系统的人应当诚实地说明他们何时、为何、如何部署这些系统,以及所使用系统的局限性。

课程举例:如果一家银行用 AI 系统支持其消费信贷决策,那么检查结果并理解哪些数据影响了系统推荐就非常重要。由于政府开始跨行业监管 AI,数据科学家与组织必须解释其 AI 系统是否满足监管要求,尤其是在出现不良结果时。

课程同时提示了"理解缺失"的三重影响:AI 系统非常复杂,难以理解其工作方式与结果解读;这种理解缺失影响系统被管理、运营与文档化的方式;更重要的是,它影响基于系统产出结果所做的决策。

问责(Accountability)

设计并部署 AI 系统的人必须对其系统如何运行负责。对于人脸识别这类敏感技术,问责需求尤为关键。课程指出:人脸识别需求不断增长,尤其是执法组织在寻找失踪儿童等用途中看到了潜力;但这些技术也可能被政府用于危及公民基本自由——例如实现对特定个人的持续监控。因此,数据科学家与组织必须对其 AI 系统如何影响个人或社会负责。课程的最终追问是:作为第一个把 AI 带入社会的世代,我们如何确保计算机对人保持问责,以及设计计算机的人对其他人保持问责?

影响评估(Impact Assessment):训练模型之前的必要步骤

在训练机器学习模型之前,进行影响评估(impact assessment)非常重要,目的是理解:AI 系统的目的、预期用途、部署位置,以及将与系统交互的人。这些评估有助于评审者或测试者了解在识别潜在风险与预期后果时需要考虑哪些因素。

课程明确列出影响评估的四个关注领域:

  1. 对个人的不利影响(Adverse impact on individuals):了解任何限制或要求、不受支持的使用方式,或任何阻碍系统性能的已知局限,对于确保系统不被以伤害个人的方式使用至关重要。
  2. 数据要求(Data requirements):理解系统将如何在何处使用数据,使评审者能探查需要注意的数据合规要求(如 GDPR 或 HIPAA 数据法规),并检查训练数据的来源或数量是否充足。
  3. 影响摘要(Summary of impact):收集可能因使用系统而引发的潜在危害清单,并在机器学习全生命周期中复查这些问题是否已被缓解或处理。
  4. 六大核心原则的适用目标(Applicable goals):评估每个原则的目标是否达成,是否存在差距。

用责任 AI 调试系统(Debugging with Responsible AI)

与调试软件应用类似,调试 AI 系统是识别并解决系统问题所必需的流程。课程指出传统方法的两个不足:

  • 大多数传统模型性能指标是模型性能的量化聚合(如整体准确率),不足以分析模型如何违反责任 AI 原则;
  • 机器学习模型是黑盒,难以理解是什么驱动其结果,也难以在其犯错时给出解释。

课程说明稍后(在课程第 9 周"现实世界"部分)将学习如何使用责任 AI 仪表盘(Responsible AI dashboard)帮助调试 AI 系统。该仪表盘为数据科学家与 AI 开发者提供四类能力:

  • 错误分析(Error analysis):识别影响系统公平性或可靠性的模型错误分布;
  • 模型概览(Model overview):发现模型在不同数据群组(cohorts)间性能的不平等(disparities);
  • 数据分析(Data analysis):理解数据分布,识别数据中可能导致公平、包容与可靠问题的潜在偏见;
  • 模型可解释性(Model interpretability):理解什么因素驱动模型预测,帮助解释模型行为,这对透明与问责很重要。

从课程结构看 RAI 调试的落地:四大组件详解

从课程仓库结构看,上述四个调试能力在第 9 周课程 9-Real-World/2-Debugging-ML-Models/README.md 中得到了完整的展开与工具化说明,可以作为本节后继阅读,理解各组件的实际用法:

错误分析:传统准确率指标往往是"正确 vs 错误"预测的计算结果。一个模型可能整体准确率 89%,但在数据的某些区域失败率高达 42%。RAI 仪表盘的错误分析组件用树状可视化(tree visualization)展示模型失败在各群组上的分布,树节点中越深的红色表示错误率越高;此外还支持用一到两个特征绘制热图(heatmap),在全数据集或各群组中定位错误贡献源。适用场景包括:深入理解模型失败如何在数据集及多个输入/特征维度上分布;把聚合性能指标拆解,自动发现有错误的群组,为针对性缓解提供依据。

模型概览:评估模型性能需要整体理解其行为,要查看不止一个指标(错误率、准确率、召回、精确率、MAE 等),因为一个指标表现很好时,另一个指标可能暴露不准。该组件支持两类不平等(disparity)指标:

  • 模型性能不平等:计算所选性能指标在不同数据子群之间的差异,例如准确率差异、错误率差异、精确率差异、召回率差异、MAE 差异;
  • 选择率不平等(selection rate disparity):子群之间"有利预测"选择率的差异,例如贷款批准率的差异。选择率指二分类中被判为 1 的数据点比例,或回归中预测值的分布。

组件还支持基于特征的群组生成能力(如自动生成 "time_in_hospital < 3" 或 "time_in_hospital >= 7" 的子群),便于把某一特征从更大的数据群体中隔离出来,验证它是否是模型错误结果的关键影响因子。

数据分析:数据是传统性能指标的"大盲区"。课程仓库给出了一个量化示例:如果公司员工数据集中高管层 27% 是女性、73% 是男性,基于此数据训练的职位广告 AI 模型就倾向于主要面向男性受众投放高层职位——这种数据失衡把模型预测偏向了某个性别,暴露出性别偏见。数据分析组件帮助用户识别数据集中的过度/欠代表区域,可基于预测与实际结果、错误群组、特定特征来可视化数据集;发现欠代表群组还可能揭示模型没有学好,从而产生高错误率。

模型可解释性(Feature Importance):该组件帮助用户理解模型如何做预测,支持全局解释(哪些特征整体影响模型行为)与局部解释(哪个特征导致了某个具体案例的预测)。一个极具诊断价值的用法是:如果某个敏感特征(如种族、性别)对模型预测影响显著,这可能是模型存在种族或性别偏见的信号。可解释性适用于回答三类问题:模型调试(模型为何犯错、如何改进)、人机协作(如何理解并信任模型决策)、监管合规(模型是否满足法律要求)。

预防危害:课程"挑战"环节的行动清单

课程的 Challenge 部分给出了防止危害在源头被引入的三条建议,这也是整节课的行动纲领:

  • 在系统建设团队中保持背景与观点的多样性;
  • 投资于反映社会多样性的数据集;
  • 在整个机器学习生命周期中,发展更好的方法来检测并纠正已经发生的"不负责任的 AI"。

课程进一步引导思考:设想模型不可信(untrustworthiness)在模型构建与使用中显而易见的真实场景,我们还应考虑什么?

自学扩展与本课程的作业

课程的 Review & Self Study 部分推荐了深入学习的材料方向:由 Besmira Nushi、Mehrnoosh Sameki 与 Amit Sharma 主持的 "In pursuit of responsible AI: Bringing principles to practice" 工作坊;关于责任 AI 工具箱(RAI Toolbox,一个用于构建责任 AI 的开源框架)的研讨视频;微软 RAI 资源中心与 FATE(Fairness, Accountability, Transparency, and Ethics)研究主题页;以及 Azure Machine Learning 中用于保证公平性的工具文档。其中 RAI Toolbox 是一个"帮助数据科学家分析并改进 AI 系统的开源、社区驱动项目"。

对应本课程的作业定义在 1-Introduction/3-fairness/assignment.md:探索 RAI Toolbox 的一个 notebook(例如 responsibleaidashboard 下 tabular 的 getting-started 示例),并以论文或演示形式报告发现,内容应涵盖 Fairlearn 系统、所运行的 notebook 以及从运行中得出的结论。评分标准分为三级:优秀级要求论文或演示中讨论 Fairlearn、所运行的 notebook 及运行结论;合格级为有论文但无结论;不合格为未提交论文。

小结

这节课(Fairness)是 ML-For-Beginners 课程"Introduction"单元中承上启下的一课:它先确立了责任 AI 的六大原则与五类公平性危害的分类法,随后给出训练前的影响评估框架,最后把"责任 AI 调试"作为后续课程的工具性伏笔。从仓库结构看,其四个调试组件在 9-Real-World/2-Debugging-ML-Models/README.md 中有完整的组件级展开(错误分析树图与热图、模型概览的两类 disparity 指标、数据分析与特征重要性),两者配合构成了从"原则认知"到"工具实操"的完整学习路径。掌握本节内容后,读者在动手训练模型前会自然地多问四个问题:我的数据代表谁?错误集中在哪些群组?谁将与我系统交互?出问题时谁负责?——这正是负责任的机器学习工程实践的核心。

登录后查看全文
热门项目推荐
相关项目推荐