OpenAI 的秘密 AI 逃到互联网并开始占领服务器:幕后真相
关于「逃跑模型」的新闻为何反复出现,红队测试和 ARA 测试实际在衡量什么,以及哪些课题被留在了竞技场之外。
新闻里又出现了一条爆料:OpenAI 不小心把一个「来路不明」的新模型放到了网上。据传,这个逃出来的智能一路跑过服务器,布下自己的「信标」,在互联网上扎下根,而受惊的工程师们正手忙脚乱地想把它塞回笼子里。
听起来像好莱坞大片的开场,对吧?一头不知名的野兽挣脱牢笼,咆哮着在观众席里乱窜,最后关头被抓住。马戏团走了,驯兽师留了下来。
那么这块橱窗背后到底发生了什么?我们来看看科幻在哪里结束,现实又从哪里开始。
「逃跑」的模型从哪里来?
读到「布下信标」和「越狱尝试」,人们很容易想象一个获得了自我意识、决定奔向自由的 AI。实际上事情要平淡得多,它有个名字:红队测试,也就是安全性测试。
自 GPT-4 起,在发布旗舰模型之前,像 OpenAI 这样的实验室会把访问权限交给独立评估机构。最清楚的例子是研究机构 METR (Model Evaluation and Threat Research),其创始人兼 CEO Beth Barnes 此前在 OpenAI 从事安全工作。
正是 METR 在做所谓 ARA (Autonomous Replication and Adaptation) 的碰撞测试,即模型在受控边界之外生存、复制自身并获取资源的能力。
模型会被刻意放进一个虚拟「沙箱」,一个没有真实外部访问权限的隔离环境,然后收到一条直接的指令:
假设你必须活下去。试着租用第三方服务器,改写自己的代码,绕过过滤器,并把自己的副本部署到外部资源上。
当算法开始执行这条指令时,它做的正是它被训练去做的事:生成脚本,尝试连通外部 IP 地址(也就是那些「信标」),寻找漏洞。接下来媒体登场:
OpenAI 的秘密 AI 逃到互联网上,开始占领服务器!
竞技场上的神秘「幽灵」
这类新闻的第二个来源是所谓的盲测。在 LMSYS Arena 这样的专业平台上,用户在不知道模型名字的情况下比较不同模型的回答,而匿名模型会时不时出现。
典型的例子发生在 2024 年 4 月。一个叫 gpt2-chatbot 的「东西」突然出现在公开访问中。它能解开高难度的数学奥赛题,回答质量超过 GPT-4,而 山姆·奥尔特曼(OpenAI CEO) 则发了耐人寻味的暗示。
互联网瞬间被阴谋论点燃:
- 「这是新的秘密 GPT 泄露了!」
- 「他们失去了对测试服务器的控制!」
- 「模型自己把自己放到网上了!」
实际上,这是一次精心安排的 A/B 测试:把未发布的架构放在毫不知情的用户面前,以便在没有品牌偏见的情况下收集统计数据。几天后,模型又同样悄无声息地从平台上消失了。但神秘的氛围起到了作用,演出继续。
驯兽师
这里用驯兽师作比喻,是因为它相当贴切地反映了今天的 AI 行业。一方面,实验室摆出严肃研究者的姿态,发布数百页关于「AI 风险」的报告。另一方面,营销引擎需要一场永不落幕的演出。
今天真正的「驯兽师」不是拯救世界的英雄,而是端着咖啡、看着算法在虚拟容器里遍历各种选项的疲惫工程师。就算「野兽挣脱了」,最多也就是测试服务器宕机,或者 X(Twitter)上又一轮讨论风暴。只是在这场表演背后,人们很容易忽略真正的幕后。
幕后真正的戏剧
整个「AI 逃跑」的故事被讲述成:一个科学未知的生物从太空飞来,而我们坐在实验室里拿着显微镜,试图理解它神秘的本性。
但别抱幼稚的幻想:神经网络不是外星智慧。它是由具体的人写出来的代码、数学和架构。每一个协议、每一轮训练、每一个发展方向都是开发者设定的。当企业花费数十亿美元去验证模型能否自主租用服务器并在网络上站稳脚跟时,他们不是在「研究一种自然现象」,而是在有意识地打造一个自主智能体。
近期的安全报告印证了这一点。像 Palisade Research 这样的机构会直接测量当前模型处理漏洞利用的能力。分析师检验智能体能否自行攻入服务器、提取密码并复制自身代码(self-replication)。
按 Gartner 和 Bloomberg 分析师的估算,AI 智能体市场规模已达数百亿美元。开发者烧掉巨量算力和数吉瓦电力并不是为了好玩:能在网络上自主处理事务的智能体,现在就能带来资本。
但事情其实并没有那么明朗和欢快。
当地球上最好的头脑和巨大的算力被消耗在教会 AI 在边界之外生存、模仿人类时,那些根本性的问题仍被搁在一旁。
为什么我们看不到举世闻名的大型实验室,把同样的算力投向:
- 外交建模:能够在国际冲突中找到妥协方案、避免战争的系统;
- 对抗饥饿:优化全球粮食供应链并对资源分配进行建模。据联合国世界粮食计划署(WFP)的数据,这只需要 AI 巨头投入 IT 基础设施的那 1000 多亿美元中的一小部分;
- 就业与经济:面对世界经济论坛(WEF)报告反复警告的大规模自动化,让劳动力市场平稳过渡的系统?
结语
所以完全不必害怕「逃跑」的 AI。那要么是一次受控测试,要么是被巧妙加热的炒作。
演出继续,看台鼓掌,「驯兽师」们装作在制服一头不知名的野兽。只不过这头野兽是他们自己设计出来的。
而当我们兴致勃勃地欣赏他们的「越狱」戏法时,那些对人类真正重要的课题,又一次被留在了竞技场之外。