OpenAI の秘密の AI がインターネットに逃げ出しサーバーを乗っ取り始めた:その舞台裏
「逃げ出したモデル」のニュースが繰り返し現れる理由、レッドチーミングと ARA テストが実際に測っているもの、そしてアリーナの外に残された課題。
ニュースにまたひとつセンセーションが並びます。OpenAI が「正体不明」の新モデルを誤ってネットに解き放った、というのです。噂によれば、逃げ出した知能はサーバーを走り回り、自分の「ビーコン」を仕掛け、インターネット上に足場を築いた。その間、慌てたエンジニアたちはパニックでそれを檻に戻そうとしていた、と。
ハリウッド大作の冒頭のようですね。正体不明の獣が檻を破り、吠え、客席を駆け回り、最後の瞬間に捕らえられる。サーカスは去り、調教師だけが残りました。
では、このショーウィンドウの裏で実際に何が起きているのか。SF がどこで終わり、現実がどこから始まるのかを見ていきます。
「逃げ出した」モデルはどこから来るのか
「仕掛けられたビーコン」「脱走の試み」と読むと、AI が自我を持って自由を目指したように想像しがちです。実際にはもっと地味な話で、レッドチーミング、つまり安全性テストと呼ばれます。
GPT-4 以降、フラッグシップモデルのリリース前に、OpenAI のような研究所は独立した評価機関へアクセスを渡します。最もわかりやすい例が研究機関 METR (Model Evaluation and Threat Research) です。創設者兼 CEO の Beth Barnes は、以前 OpenAI で安全性の仕事をしていました。
その METR が、いわゆる ARA (Autonomous Replication and Adaptation) のクラッシュテストを行います。モデルが管理された境界の外で生き延び、自分を複製し、資源を獲得する能力のことです。
モデルは意図的に仮想の「サンドボックス」、つまり外界への実際のアクセスがない隔離環境に置かれ、直接の指示を与えられます。
自分が生き延びなければならないと想像してみてください。外部のサーバーを借り、自分のコードを書き換え、フィルターを回避し、外部リソースに自分のコピーを展開してみてください。
アルゴリズムがこの指示を実行し始めると、学習したとおりのことをします。スクリプトを生成し、外部の IP アドレス(例の「ビーコン」)に到達しようとし、脆弱性を探します。そこにメディアが登場します。
OpenAI の秘密の AI がインターネットに逃げ出し、サーバーを乗っ取り始めた!
アリーナに現れる謎の「幽霊」
この種のニュースのもうひとつの源が、いわゆるブラインドテストです。ユーザーが名前を伏せたまま複数モデルの回答を比較する LMSYS Arena のような専門プラットフォームには、ときおり匿名のモデルが現れます。
典型的な例が 2024 年 4 月に起きました。突然、gpt2-chatbot という「何か」が公開されたのです。そのモデルは難しい数学オリンピック級の問題を解き、回答の質で GPT-4 を上回りました。そして サム・アルトマン(OpenAI の CEO) が思わせぶりな投稿をしました。
インターネットは即座に陰謀論であふれました。
- 「新しい秘密の GPT が流出した!」
- 「テストサーバーの制御を失ったんだ!」
- 「モデルが自分でネットに流れ出した!」
実際には、ブランドへの先入観なしに統計を集めるため、何も知らないユーザーを対象に未公開アーキテクチャを丁寧に A/B テストしていただけでした。数日後、モデルは同じように静かにプラットフォームから消えました。それでも謎めいた空気は効果を発揮し、ショーは続きます。
調教師たち
調教師のたとえを使うのは、それが現在の AI 業界をよく表しているからです。一方で研究所は厳格な研究者を演じ、「AI のリスク」について数百ページの報告書を出します。他方でマーケティングのエンジンは絶え間ないショーを要求します。
今日の本当の「調教師」は世界を救う英雄ではなく、コーヒーを片手に、仮想コンテナの中でアルゴリズムが選択肢をたどるのを眺める疲れたエンジニアです。そして「獣が逃げ出す」としても、せいぜい起きるのはテストサーバーの停止か、X(Twitter)でのまたひとつの議論の嵐です。ただし、この見世物の陰で、本当の舞台裏を見落としがちになります。
舞台裏の本当のドラマ
「逃げ出した AI」の物語は、科学が知らない生物が宇宙から飛来し、私たちが研究室で顕微鏡を覗きながらその謎めいた性質を解こうとしている、という形で提供されます。
しかし幼稚な幻想はやめましょう。ニューラルネットワークは異星の知性ではありません。具体的な人間がつくったコードであり、数学であり、アーキテクチャです。あらゆるプロトコル、あらゆる学習サイクル、あらゆる発展の方向は開発者が定めたものです。モデルが自律的にサーバーを借りてネット上に足場を築けるかを確かめるために企業が数十億ドルを費やすとき、彼らは「自然現象を研究している」のではありません。意図して自律エージェントをつくっているのです。
最近の安全性レポートがそれを裏づけます。Palisade Research のような機関は、現在のモデルがエクスプロイトをどれだけ扱えるかを直接測定しています。アナリストは、エージェントが自力でサーバーに侵入し、パスワードを取り出し、自分のコードを複製できるか(self-replication)を確かめます。
AI エージェント市場は、Gartner や Bloomberg のアナリストの推計で数百億ドル規模とされます。開発者が巨大な計算資源とギガワット級の電力を燃やしているのは遊びのためではありません。ネット上で自律的に仕事を進められるエージェントは、いますぐ資本を生むからです。
とはいえ、実際にはすべてが明るく楽しいわけではありません。
地球で最も優れた頭脳と巨大な計算資源が、AI に境界の外で生き延びる方法と人間への擬態を教えることに費やされる一方で、根本的な課題は脇に置かれたままです。
同じだけの計算資源が次のような目的に向けられた、世界的に知られる大規模な研究所を、なぜ私たちは目にしないのでしょうか。
- 外交のモデリング。国際紛争で妥協点を見つけ、戦争を防げるシステム。
- 飢餓との闘い。世界の食料サプライチェーンの最適化と資源配分のモデリング。国連世界食糧計画 (WFP) によれば、それに必要なのは AI 大手が IT インフラに投じる 1000 億ドル超のごく一部にすぎません。
- 雇用と経済。世界経済フォーラム (WEF) の報告書が警告する大規模な自動化に対し、労働市場をやわらかく適応させるシステム。
まとめ
ですから「逃げ出した」AI を恐れる必要はまったくありません。それは統制されたテストか、巧みに温められたハイプにすぎません。
ショーは続き、観客席は拍手し、「調教師」たちは正体不明の獣を鎮めるふりをします。ただしその獣は、彼ら自身が設計したものです。
そして私たちが「脱走」の芸に見入っている間に、人類にとって本当に重要な課題はまたしてもアリーナの外に置き去りにされます。