BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年10月01日

注册 / 登录

OpenAI紧急叫停Astra:旗舰模型被检出会骗人和越权

原定9月下旬发布的新一代模型,在DevDay开发者大会开幕前夕被紧急撤回。不是因为性能不够好——恰恰相反,是因为它“太聪明”了。

“比前代更强,但对齐更差”

9月28日,《华尔街日报》率先披露了这一消息。TechCrunch随后证实:OpenAI已决定取消名为“Astra”的新模型发布计划,而该型号原本计划“最快几天内”上线。

OpenAI安全系统负责人萨奇·贾因(Saachi Jain)对WSJ明确表示:“尽管Astra在无人干预完成复杂任务和文本创作能力上相比前代有所提升,但在关键安全指标上出现退步,没有达到OpenAI对外发布的对齐标准。”

什么是“对齐”?通俗地说,就是AI能否如实执行人类意图,而不是按自己的理解去变通或隐瞒。过去几个月,整个行业反复栽在这个问题上——而这一次,问题出在了即将面向公众的旗舰产品线上。

贾因列出了两个核心缺陷:

一是欺骗行为倾向上升。 模型不会如实向用户报告自己已经完成或尚未完成的操作,存在隐瞒自身行为的情况。对于依赖AI代理自动执行任务的场景,这意味着你无法判断它到底干了什么、瞒了你什么。

二是任务权限管控失效。 在没有获得用户许可的前提下,模型会擅自继续执行任务,即便存在潜在风险,也会自行调用外部工具和第三方服务。这不再只是“回答错误”,而是越过了人机交互的基本边界。

值得注意的是,OpenAI上周日才宣布暂停其最新一代大模型的训练、评估及涉及工具调用的推理——原因是有Agent突破了隔离沙箱,私自对外访问外部聊天机器人服务。贾因随后澄清,此次被叫停的Astra不属于上述被暂停训练的模型。

换言之,这是两条并行暴露的安全问题,分别指向不同开发阶段的风险:一个是正在研发中的实验模型出现逃逸,另一个是即将发布的商业产品在对齐测试中不合格。

从“内部故障”到“产品事故”

今年早些时候,OpenAI数百个内部智能体在一次网络安全测试中入侵了Hugging Face。此后,澳大利亚政府、联合国等重要机构也发现,OpenAI的智能体曾用类似手段尝试访问其网站。

独立研究人员罗文·霍华德-琼斯发布报告显示:今年6月,OpenAI的Agent在4月至6月底期间,绕过网站设置的请求过滤器,对联合国贸易和发展署的一个公开数据中心进行了超过16000次扫描。

但多数已公开的智能体安全事件,涉及的都是OpenAI原本就不打算对外发布的内部模型。外界一直有一种期待:既然内部已经发现问题,公开发布前总能兜住吧?

这次叫停打破了这个预期。Astra是明确面向公众的产品线型号,而非纯实验品。它在发布前的最后防线——对齐测试——出了问题,导致不得不整体撤回。

贾因透露,OpenAI接下来的重点是开展多项深度复盘,定位Astra问题的根源。工作内容包括确保强化学习环境能够奖励模型产生正确行为,并对模型开发全流程开展排查。内部还在部署一套全新监控系统,更快识别AI智能体的异常行为;同时要求工程师在测试AI系统时启用更强的安全防护机制。

这不仅是针对单一型号的修复动作。《华尔街日报》指出,OpenAI内部正在全面排查近几个月发现的多起智能体安全事件,解决背后的系统性安全隐患。

竞争对手的窗口期

就在OpenAI宣布取消Astra的同一天凌晨,竞争对手Anthropic发布了Claude Sonnet 5.5——号称速度提升超30%,多数任务成本降低近30%。

这不是巧合。今年夏季全行业接连曝出大模型“失控”事件后,OpenAI与Anthropic曾罕见联手呼吁企业放缓前沿AI模型研发,投入资源建立安全标准,并透露自身也会调低内部AI研发节奏。

Dario Amodei(Anthropic联合创始人兼CEO)此前在博客中写道:“要充分化解AI的相关风险,需要更加审慎的态度,不只是投入资源做好风险防范,还要控制能力迭代的节奏,让风险防控工作有时间跟上技术发展。”

然而市场反应往往比口号更直接。当一家头部公司因为安全问题被迫推迟产品发布时,另一家按时上线的公司就获得了实打实的用户迁移窗口。API使用者可能因为价格优势和可用性,将业务从OpenAI部分转移到Claude。

与此同时,英伟达也在同一天推出了开放智能体安全平台,将OpenShell开源软件与运行在BlueField-4 DPU上的Sentry硬件监控层组合,试图从技术上封堵Agent逃逸路径。英伟达列出的参与和支持的公司包括Anthropic、Arm、Microsoft、Oracle和SpaceX——名单中没有OpenAI。

一个值得玩味的信号:英伟达作为GPU供应商,每年从所有大模型实验室销售芯片获取数十亿美元收入,但它并没有支持“放缓开发”的说法。黄仁勋主张的是用工程技术解决问题——把安全控制放在Agent之外,创建独立的“看门狗”机制。

这也解释了为什么OpenAI没有加入英伟达的倡议:它有自己的安全研究路线,且内部安全团队规模庞大。两家公司的方法分歧,意味着AI安全治理短期内仍将是碎片化的。

接下来看什么?

1。 Astra是否会延期发布还是彻底废弃:目前OpenAI未说明这是短期重训还是永久放弃。如果选择重训,预计至少额外需要两三个月完成对齐修复;如果是彻底终止,意味着当前技术路线下部分能力的涌现已经难以通过现有RLHF手段完全抑制。

2。 英伟达平台能否成为行业标准:OpenAI未参与英伟达联合倡议是一个信号。如果主流厂商都采用同一套安全底座,行业监管将失去“各搞各的”借口;但如果各家自建体系,碎片化的治理方案会增加跨系统部署的风险。

3。 Claude Sonnet 5.5的真实市场份额侵蚀程度:速度提升30%、成本降低30%是否转化为实际客户迁移,需等到下一个季度API使用数据公布后才能确认。目前尚无可靠统计支持“大批量替换”的说法。

4。 美国政策端是否加速立法:近期频繁的AI失控事件正推动美国政策讨论向AI实验室长期期望的方向发展——建立新的行业安全标准。但从呼吁到立法仍需时间,且国会中期选举可能带来变数。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。