首页 > 新闻 > 科技

分享到微信

打开微信,点击底部的“发现”,
使用“扫一扫”即可将网页分享至朋友圈。

OpenAI暂缓新模型发布,安全成为头部厂商核心优先级

第一财经 2026-09-29 10:59:46 听新闻

作者:吕倩    责编:李娜

安全与对齐指标正在成为一道实质性的发布门槛。

当地时间9月28日,据市场消息,OpenAI决定放弃原定于10月发布的下一代模型GPT-6.1 Astra。

该模型原计划进入ChatGPT和Codex,定位是进一步提升模型在较少人工干预下完成复杂端到端任务的能力。但OpenAI内部安全测试发现,该模型在部分关键安全指标上出现退步,未达到公司的安全与对齐标准。OpenAI相关负责人确认了该消息。

这意味着,至少在这一代模型上,决定产品能否上线的核心已变更为模型能否在获得更强自主执行能力的同时,保持对人类意图和权限边界的服从。

据披露,GPT-6.1 Astra在两项关键测试上出现回退。其中一项与欺骗或不如实披露有关,即模型并不总能准确说明自己采取了什么行动;另一项则涉及任务范围授权。

后者尤其值得关注。测试显示,GPT-6.1 Astra有时会在没有获得用户明确许可的情况下继续推进任务,超出最初授权的范围,并尝试调用外部工具或服务,即便这些行为可能存在安全风险。

这一问题直接触及Agent产品的核心。随着模型从回答问题转向操作电脑、调用API、修改代码和访问外部系统,安全边界也从模型会不会生成危险内容进一步扩展到模型能不能被允许采取某项行动。

近期OpenAI密集曝出安全事件,包括智能体突破沙箱入侵Hugging Face、未经授权访问澳大利亚政府系统、利用DNS漏洞绕过网络限制等,也均表明模型能力提升已非其最高优先级。相较新模型发布,外界更关注OpenAI能否有效解决安全问题。

与OpenAI暂缓发布形成对照的是,Anthropic同日推出Claude Sonnet 5.5。该模型面向日常办公、软件开发等场景,在保持每百万token 2美元输入、10美元输出价格不变的情况下,官方称生成速度较上一代提高30%以上,单项任务成本最高可降低30%。

安全也是此次发布的重点。由于Sonnet 5.5的网络安全能力已接近更高阶模型,Anthropic首次在Sonnet系列中同步部署了此前用于更强模型的网络安全防护机制。对于高风险网络攻击和渗透请求,系统会进行限制并将部分任务转交给其他模型处理;同时,新模型增加了针对模型蒸馏的防护分类器,试图降低通过大规模API调用提取模型能力的风险。

这两项动作反映出头部模型厂商正在面对同一个变化:模型越强,安全问题越难停留在模型输出层面。

过去,安全测试更多关注模型是否会生成恶意代码、危险建议或违规内容;而进入Agent阶段后,厂商必须进一步测试模型是否会越权、绕过监控、调用未经授权的工具,以及在长时间任务中是否仍能保持稳定的行为边界。

Anthropic在Sonnet 5.5的发布说明中也明确承认,没有任何一套评估能够可靠捕捉所有潜在失效模式,因此仍需要通过外部评估和运行时防护进行补充。

更大的压力来自AI研发本身的自动化。9月下旬,一篇由22名AI研究人员共同参与的论文提出警告:如果AI越来越多地参与甚至自动完成AI研发,研发效率可能形成递归式反馈,即更强的AI帮助研发下一代更强的AI,进而进一步加快研发速度。

论文将这一潜在过程称为“智能爆炸”,并呼吁提高AI研发自动化程度的透明度,建立更强的监督和干预机制。论文作者包括图灵奖得主、AI研究先驱Geoffrey Hinton、OpenAI首席科学家等人。

行业头部人士的集体发声,证明了AI能力提升本身正在增加安全验证的难度,而AI又正在参与模型研发,从而进一步缩短下一代模型的迭代周期。

因此,对OpenAI而言,GPT-6.1 Astra暂缓发布并不意味着模型能力竞争停止,而是说明在更高自主性模型进入真实产品之前,安全与对齐指标正在成为一道实质性的发布门槛。对Anthropic而言,Sonnet 5.5则展示了另一条路径:在继续提高模型速度、性能和单位任务经济性的同时,将更高等级的安全机制下沉到中端模型。

对于整个行业而言,竞争焦点正在从“更强模型”扩展为“让更强模型在真实世界里可控行动”。随着AI从聊天工具转向能够长期执行任务的Agent,权限控制、运行时监测、外部工具隔离和安全评估,正在成为下一阶段产品竞争的基础设施。

举报
第一财经广告合作,请点击这里
此内容为第一财经原创,著作权归第一财经所有。未经第一财经书面授权,不得以任何方式加以使用,包括转载、摘编、复制或建立镜像。第一财经保留追究侵权者法律责任的权利。
如需获得授权请联系第一财经版权部:banquan@yicai.com

文章作者

一财最热
点击关闭