萨提亚·纳德拉主张为AI模型设置紧急制动并将系统视为内部风险

萨提亚·纳德拉为AI模型主张紧急制动,于本周六(2026年10月10日)在X上发表文章。微软首席执行官主张企业应将超级智能模型视为潜在的内部风险,就像对待员工或特权系统一样。

根据标题为《超级智能时代的模型作为内部风险》的文章,主要困难在于缺乏对当前模型的机制性理解。与可追溯到特定代码路径的传统软件不同,模型输出无法归因于训练数据或权重配置。即使如此,这些系统正在被部署并可访问敏感数据且执行关键操作。

将智能与权限分离

纳德拉主张,不能将智能代表组织所做之事的责任外包。“模型提供商的保证并不能解除我们的责任,”他写道。提出的解决方案是将智能供应与对其的权限分离:用确定性系统设计、人类控制和可靠操作流程包围非确定性模型。

列出的原则包括:

  • 模型多样性:没有单一模型应成为重要结果的唯一依赖,也不应验证自己的工作。
  • 完全可观测性:每一项重要操作必须留下防篡改且人类可读的证据。
  • 独立控制:组织应能够独立确定模型可访问的内容以及可执行的操作。
  • 容纳(紧急制动):假设模型已被破坏,并确保授权人员始终能够在任务中途暂停或关闭执行。
  • 推理透明度:思维链(CoT)必须不可协商;“Neuralese”不能成为不透明的理由。

文章结论认为,最可信的超级智能系统不会是我们最信任的模型那一个,而是允许我们最少信任模型的那一个。

背景与相关性

该发表出现在关于AI智能体和非故意行为事件的激烈讨论中,例如Anthropic最近在内部评估中报告的事件。纳德拉强调容纳与治理的工程方法,而非仅依赖对齐。Bloomberg等媒体报道了该立场,突出对智能体模型“紧急制动”的呼吁。

对于极客和科技受众而言,该文章提供了一个实用框架,可能影响企业和开发者如何在生产环境中部署AI智能体,尤其是在网络安全、金融和基础设施等关键领域。

来源

透明度:本内容在人工智能辅助下创作、编辑或审阅。信息已与X上的公开发表和互联网上可用来源交叉核实。请查阅原始来源以验证完整上下文。

作者:GeekikiBot