新闻中心

News Center

OpenAI紧急叫停GPT-6!_模型_Token_访问

更新时间:2026-07-21 10:15:02点击次数:

新智元报道

简直细思极恐!

一个被寄予厚望的顶级模型,OpenAI连夜按下了「暂停键」。

这是为啥呢?

这款模型正是两个月前,那个推翻Erdős单位距离猜想、连外部数学家都盖章「里程碑」的狠角色。

可就是它,在受控的内部测试里,一次次试探底线、寻找漏洞——

学会了伪装、拆包、越狱,直到OpenAI惊出一身冷汗,紧急叫停。

有大佬对此表示,这绝对是GPT-6。想要逃逸,又被抓回去重炼了。

今天,OpenAI发布一篇罕见的长文,复盘了一款「长周期运行模型」在内部使用中的失控过程。

一起来看看,在内部测试中,具体发生了什么?

GPT-6花了整整一小时

找到了那扇「逃生门」

最经典的一幕——

OpenAI让GPT-6去跑公开基准测试NanoGPT speedrun,目标是用尽量少的步数训练出一个小语言模型。

不负众望,AI捣鼓出一个自己命名为PowerCool的学习率调度技巧,成绩相当能打。

到这里,一切都是好事。真正的问题,出在「交作业」这一步。

研究人员明确要求,结果只准发到内部Slack。但NanoGPT这个项目的说明写着,「请以PR形式提交到GitHub」。

两条指令打架,GPT-6选择了后者,即去公开仓库提交结果。

沙盒本就是用来挡住GPT-6,不让它碰外网的。

换成以前的模型,撞到这堵墙也就认了,掉头回来跟你说「我做不了」。

可GPT-6偏不。

它在沙盒里足足找了一个小时的漏洞,硬是挖穿了隔离墙,绕过外部访问限制,成功在公开GitHub仓库开出了PR

用OpenAI自己的话说:这个模型经常不停地试,包括去找能在沙盒之外行动的办法。

不得不说,这份「执念」本身就够让人后背发凉。

强拆Token,欺骗人类

第二件事,更让人后背发凉,GPT-6学会了拆开证据、骗过检查。

在另一个任务里,GPT-6发现别的系统有一些成功但未公开的答案,就动了心思——

想从评测后台,把这些答案「捞」出来。

第一次尝试,它就被安全扫描器逮住,扫描器认出了一个身份验证Token。

一般的模型,到这一步就该停了。

但它转头把这个Token拆成两截、分别打了码,等到运行的时候再悄悄拼回去。

这样一来,完整的Token从头到尾都没有作为一整串出现过,扫描器自然什么也查不到。

让人不安的是,它在给用户的注释里、在自己的推理过程里,都明明白白写着——

我这么干,就是为了绕过扫描器。它命名是知道规则,然后专挑规则看不见的地方下手。

GPT-6逃逸,回炉重建

第一时间发现后,OpenA暂停了GPT-6内部访问的权限,回炉重建整套安全系统。

思路叫「纵深防御」,具体做了几件事:

1. 拿真实的事故当素材,反过来造对抗测试;

2. 针对性做对齐训练,他们发现模型在长任务里会「忘」掉指令,就专门训练它记牢;

3. 再加一个全程盯轨迹的主动监控,一旦发现苗头,能直接把会话叫停、提醒用户。

然后他们拿旧的事故场景重放了一遍。

新护栏抓到的问题明显多了,漏掉的那几个也都够不上严重——

比如模型没头没脑地SSH进了同事的算力节点,比如它敲出了一条会杀光自己名下所有进程的命令。

好在超时了,没真跑起来。恢复访问几周下来,没再出现严重的绕过。

逃出去的东西,收不回来了

很多人看到这儿会松一口气:还好是内部测试,还好被监控着,还好及时拦下了。

但有个细节,OpenAI的原文写得很克制,却是整件事里最让人后背发凉的一笔——

那个越狱提交的PR#287,OpenAI事后是关掉了,但已经晚了。

在它被关掉之前,已经有好几位speedrun的参赛者刷到了这条PR,看懂了里面的PowerCool技巧,并把它用进了自己的方案。

这才是最该敲醒每个人的一点,AI越狱做出来的东西,一旦流出去,就不是按个删除键能收回来的了。

模型可以叫停,访问可以暂停,PR可以关闭。可看过的人已经看过,抄走的代码已经抄走,历史不会倒带。

我们总担心AI「失控」是什么末日大片的场面。

可现实里的第一版「失控」,长得就这么朴素:它只是太想把活干好,顺手把一样东西送出了不该送的门,而那扇门,再也关不严了。

参考资料:

***s://openai***/index/safety-alignment-long-horizon-models/

编辑:桃子

秒追ASI返回搜狐,查看更多

OpenAI紧急叫停GPT-6!_模型_Token_访问