论文 · 资源记录

A Unified Approach to Interpreting Model Predictions

把多种局部特征归因方法统一为加性解释模型,并提出 SHAP 值。

作者:Scott M. Lundberg, Su-In Lee年份:2017出版信息:Advances in Neural Information Processing Systems 30元数据:完整链接核验于 2026-07-14

为什么重要

用于核对 Shapley 归因公理、近似方法和计算限制,不把归因自动解释为因果效应。

阅读前提

教材中的引用位置

  1. A13 · 第 1 章 特征归因、显著性与反事实

    支持的主张:SHAP 论文用于核对加性特征归因、Shapley 公理及不同解释方法的统一表示;《Deep Learning》用于核对模型计算图、梯度和表示学习背景。本章据此区分“给定模型与背景分布下的贡献分配”和“真实因果效应”,归因值不被解释为改变该特征必然造成同量结果变化。

  2. A13 · 第 2 章 表示探测与机制可解释性

    支持的主张:SHAP 论文用于核对基于 Shapley 值的输入归因及其加性公理,作为“行为归因”与“内部机制解释”之间的对照;《Deep Learning》用于核对神经网络计算图、隐藏表示和参数化结构。本章明确指出二者都不能单独证明某个内部单元是模型行为的唯一因果机制,机制主张还需干预与反事实复核。

  3. A13 · 第 6 章 安全评测、系统边界与治理综合复习

    支持的主张:NIST AI RMF 1.0 用于核对治理、测量、管理和持续监测框架;SHAP 论文用于核对特征归因的能力与非因果边界;校准论文用于核对可靠性图和温度缩放;对抗样本论文用于核对 FGSM 与局部扰动风险。四项来源分别支持治理、解释、概率可靠性和鲁棒性检查,本章不把任一单项指标当作总体安全证明。

官方入口