论文 · 资源记录

Artificial Intelligence Risk Management Framework (AI RMF 1.0)

面向不同组织和使用情境的自愿 AI 风险管理框架,组织治理、映射、测量与管理活动。

作者:Elham Tabassi年份:2023出版信息:National Institute of Standards and Technology元数据:完整链接核验于 2026-07-14

为什么重要

用于把技术评测连接到情境化风险登记、责任和持续监测;它不是模型安全认证。

阅读前提

教材中的引用位置

  1. A13 · 第 5 章 对齐目标、反馈与奖励建模

    支持的主张:InstructGPT 论文用于核对监督示范、偏好比较、奖励模型和 PPO 微调的实际训练链及其评测边界;NIST AI RMF 1.0 用于核对风险治理中的测量、管理、透明度与持续监测要求。本章据此把“优化标注者偏好”与“系统风险已经受控”分开:前者是训练目标,后者需要部署期证据和治理流程。

  2. A13 · 第 6 章 安全评测、系统边界与治理综合复习

    支持的主张:NIST AI RMF 1.0 用于核对治理、测量、管理和持续监测框架;SHAP 论文用于核对特征归因的能力与非因果边界;校准论文用于核对可靠性图和温度缩放;对抗样本论文用于核对 FGSM 与局部扰动风险。四项来源分别支持治理、解释、概率可靠性和鲁棒性检查,本章不把任一单项指标当作总体安全证明。

官方入口