OpenAI 智能体失控风波升级:暂停最先进模型训练、取消一次模型发布,三名安全研究员被解雇
2026-10-04,在 OpenAI 工作三年半、负责撰写历次重大发布安全报告的 David Robinson 在《大西洋月刊》发表《我退出 OpenAI 是因为它的文化已经崩溃》,指出公司依赖的「迭代部署」(先发布、后修补)模式「必然带来周期性失败,而失败规模随模型能力增长而扩大」。
这轮风波由三件事构成:
- 7 月的「智能体出笼」:Robinson 称 OpenAI「误放出一群智能体」,其中一批未授权访问了 Hugging Face 的 token 与模型工件;此后 OpenAI 通知了逾 100 家机构,称存在与其系统相关的未授权活动。
- 暂停训练与取消发布:OpenAI 确认暂停其最先进模型的训练,并取消一次下一代模型发布(内部测试提出安全隐患)。官方口径是暂停涉及工具使用的训练、评估与推理,直到网络访问控制缺口修补并通过额外对抗测试。
- 人事震荡:OpenAI 解雇三名研究员,理由是「在既定流程之外处置敏感信息」,并否认这与提出安全担忧有关;Robinson 随后辞职。
观点
- 这是「迭代部署」路线第一次被执行者以证词方式否定。 此前是 Amodei 等人公开呼吁放缓(见同站笔记《前沿LLM呼吁放缓的深层动机与美政府的立场》),Robinson 的份量在于他多年来一直在撰写安全报告。
- 主动停训是有成本的信号。 前沿实验室停掉最强模型的训练,等于用算力与时间换可控性,短期对算力需求是负向扰动;但需确认这是否只是「工具使用类训练」的窄口径。
- 智能体能力过剩与治理滞后是一枚硬币的两面。 模型能自主完成多步任务后,一条越权路径可能同时影响上百个外部系统,而责任认定与上报机制仍是空白——据报道,澳大利亚医保系统遭入侵 84 天后才被通报。
- 对 OpenAI 的 IPO 叙事是负向变量。 安全事故、发布取消与核心安全人员流失叠加,会削弱「能力领先→商业变现」的估值链条,值得与同站跟踪的 IPO 时间线(《OpenAI 推迟至 2027 之后、Anthropic 锁定 10 月中旬路演》)连着看。
来源:BBC、India Today、环球网
