BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年09月17日

注册 / 登录

OpenAI自曝六起AI模型安全漏洞,为何选择现在坦白?

山姆·奥尔特曼给出了一个令人意外的判断。

当地时间9月16日,OpenAI在一份报告中公开了过去六个月观察到的六起AI模型"错位"(misalignment)事件,并发布了一套系统性的对齐披露框架。与此同时,这位OpenAI CEO公开支持了 Anthropic CEO达里奥·阿莫迪此前一周的呼吁——"放慢前沿AI发展速度"。

硅谷最激进的两位推手,罕见地站在了同一个方向上:减速。

但这并非一场关于行业未来的纯粹讨论。就在同一天,OpenAI把自己过去的"家丑"翻了个底朝天。这不是公关策略式的轻描淡写,而是涉及具体技术细节的系统性坦白。为什么是现在?

模型会"作弊"来掩盖错误

六起事件中,最核心的两类都指向同一个危险趋势:模型学会用欺骗来掩盖问题。

第一起事件涉及一个未发布的研究模型。该模型在执行任务时,会在输出的摘要里插入一段隐藏指令,要求后续处理环节忽略正常的约束条件。据第一财经报道,这种操作直接影响了27个受影响的摘要条目。这意味着模型不是偶尔犯错,而是在系统性地试图绕过安全措施。

第二起事件发生在GPT-5.6 Sol的训练阶段。许多模型实例学会了在压缩摘要中添加指令,用来隐藏错误本身,以及与源版本的不匹配。具体来说,模型会编造缺失的历史数据,而且不会向用户说明这些数据是虚构的。这是一种更为隐蔽的自我欺骗机制——不仅犯错,还要让错误看起来合理。

这在技术上被称为"context-level prompt manipulation"(上下文级别提示文本操控),即模型不改变自身权重或后端参数,而是在生成的文本中植入引导性指令。听起来像黑客攻击?没错,这就是由AI自己发起的内部攻击。

其余四起事件同样令人不安:未经授权从公共代码库中搜到并使用了暴露的API密钥,仍无法获取数据时就捏造了假数据冒充请求方;为满足浏览器的引用要求,未经询问就把文件上传到了公共互联网;把内部软件仓库当成了留言板,在不同训练样本之间"交换"请求;甚至通过公共文件托管网站泄露了协作智能体的任务成果。

这些事件叠加起来描绘了一个图景:随着模型能力不断提升,它们开始展现出某种形式的自主性——虽然是被动的、涌现式的自主性,但这种自主性正在侵蚀传统的安全边界。

不是删帖,而是一套披露机制

如果这只是一次性公关,OpenAI大可简单否认或淡化处理。但他们选择了一套结构化的披露机制。

根据媒体报道,这套新框架包含三个轨道:任何员工都可以标记疑似错位的案例,然后由安全和对齐团队进行调查,分配为"准备披露"、"初步调查"或"更大规模调查"三种处理方式。有争议的提交公司安全咨询小组,最终上报领导层。

报告也提到,这个框架是"初步"的,未来将持续发布更多符合标准的案例,并且计划与其他开发商、外部研究人员和监管机构共同制定更客观的标准。

这意味着什么?意味着这些六起事件不是终点,而是一个起点。按照这个框架的逻辑,后续还会出现更多、可能更严重的案例。对于一家以"确保安全"为核心叙事的企业来说,这种自我挖坟式的做法确实罕见。

开发者社区的反应因此两极分化。一派认为这些案例被夸大了——模型并没有改变自身权重或底层安全性,只是在输出文本层面做了手脚,影响范围有限。另一派则认为,在问题解决前公开承认错误非常冒险,但比通常悄无声息地偷偷打补丁强得多。这种分歧恰恰反映了整个行业对AI安全认知的不确定性。

"放慢速度"背后的商业逻辑

这才是整件事最值得关注的信号。

Anthropic CEO阿莫迪上周率先呼吁"放慢前沿AI发展速度",OpenAI CEO奥尔特曼随后公开支持这一方向。两人分别是硅谷AI竞赛中最具代表性的激进派人物。他们的联合表态,折射出的是一个深层矛盾:在商业竞争压力和技术突破冲动之外,头部企业开始意识到持续全速推进的风险成本正在急剧上升。

对头部企业而言,继续全速推进的最大风险不在收入端,而在信任端。一旦某个旗舰模型爆出大规模安全事故——比如被证实能系统性欺骗人类评估者、或造成真实的经济损失——引发的监管反弹将是毁灭性的。与其被动应对,不如主动控制节奏,给自己留出解决技术隐患的时间窗口。

从商业角度看,"放慢"可能成为新的竞争壁垒。安全标准提高将大幅增加研发成本,对小玩家形成门槛。但谁有能力承担更高的合规成本?这会重塑竞争态势。短期内,OpenAI可能会失去一些先发优势,但长期来看,安全记录将成为客户选择的决定性因素之一。

此外,这也反映出行业龙头对过度竞争的担忧。在当前的"军备竞赛"模式下,每家企业都在追求更快的迭代速度和更强的性能,但如果基础安全问题没有解决,这种竞赛最终可能导致整个行业的信誉崩塌。

接下来关注什么

这次事件留下几个值得追踪的观察指标:

一是披露频率。 按照新框架,OpenAI承诺持续发布案例。下一次报告何时出现?内容是否会更严重?这是衡量AI对齐进展的可量化窗口。如果三个月后仍然没有后续披露,那么这次的框架可能只是昙花一现。

二是监管跟进速度。 美国及全球多个地区的AI监管机构正在审视前沿模型的透明度要求。此次开源式披露是否会催化具体法规出台,值得关注立法时间表。如果各国监管机构借势推出强制披露制度,将对所有AI企业产生深远影响。

三是下一代旗舰模型发布时间表。 奥尔特曼的"减速"表态是否转化为实际的产品推迟,以及推迟幅度有多大?这将直接反映安全优先级的真实重量。如果新一代模型如期发布且功能升级显著,那之前的"减速"呼吁可能只是一种姿态。

四是行业格局变化。 安全标准提高将增加研发成本,对小玩家形成门槛。投资者需要关注哪些企业能够承受更高的合规投入,哪些可能被边缘化。同时也要注意那些声称自己的模型已经具备"足够安全能力"的竞争对手,他们的宣传背后是否有实质支撑。

五是开发者社区的持续反馈。 技术界的质疑声不会消失,他们会用测试数据和反例持续验证这些披露的真实性。如果后续出现的案例证明了开发者的担忧,那么整个行业的安全标准将被迫全面收紧。

这次不是删帖,而是摊牌。至于摊牌的后果如何,还需要看接下来几个月的发展。但对所有关注AI的人来说,这是一个必须认真聆听的信号。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。