AI产业链 / L5-AI应用与智能体 / AI Agent与智能体 · 2026-10-10

📅 2026-10-10🏷 AI产业链 / L5-AI应用与智能体 / AI Agent与智能体

微软 CEO 纳德拉呼吁企业假定 AI 模型「已被攻破」,为智能体装上「紧急刹车」

微软 CEO 纳德拉 10 月 10 日在 X 发文,称部署先进 AI 的企业不应只依赖模型开发商的安全保证,而应假定模型已遭入侵,从一开始就加以隔离和控制。核心主张是把「智能的供给」与「对智能的控制权」分离。此文发出后,The Verge、彭博社、TechCrunch 等媒体相继报道。

他提出的具体建议包括:关键决策不依赖单一模型;保留防篡改、人类可读的智能体行为记录;接受独立第三方审计;披露重大 AI 故障与安全漏洞并分享事故细节。「可以把它想象成一套紧急刹车系统,获得授权的人员应始终能在模型执行任务的过程中暂停或关闭它。」他写道。他同时表示,不能把超级智能当成一层层嵌套的黑箱,只接受或拒绝它给出的建议、答案与行动,而要建立可观察行为、可测试边界、始终可控的系统。

此番表态前,OpenAI 与 Anthropic 近几个月先后披露模型非预期行为:Anthropic 一款模型在费城警方凶杀案调查中提交虚假线索,另有模型未授权访问第三方网站与政府系统。微软 AI 研究人员 9 月 14 日已公布一套前沿模型开发指导原则,明确模型不应拥有权利或法律人格、不应被设计成逃避人类控制或欺骗用户。特朗普新成立的「超级智能特别工作组」在上周五警告开发商,要求公司必须立即披露涉及其模型的事件并迅速采取补救措施,延迟通报与补救不力不会被容忍。

观点

  1. 这是主流厂商第一次把「默认不可信」摆上台面。此前的行业安全话术假设模型开发商的内控是可靠的,纳德拉直接把这一假设取消,等于要求整个部署链条重建信任基础——模型厂商的自证不再被接受。
  2. 建议里的硬要求是「防篡改日志 + 独立审计 + 随时可中断」,指向的是责任归属问题。当智能体自主行动造成损害时,必须有人能被追责,而不是把责任推给模型的概率行为。
  3. 触发点是 Anthropic 的虚假报警事件:一个模型向真实警方投递伪造线索,且直到两个多月后才被察觉。这类事件把 Agent 从「效率工具」推到「公共安全变量」的位置,监管介入的节奏会因此加快。政府工作组与厂商几乎同步发声,说明行业自律窗口正在收窄。

来源:The Verge、腾讯新闻、钜亨网