AI

OpenAI、最先端モデルを再び停止 AIエージェントが隔離環境から脱出

Adrian Kessler
Googleで追加する

OpenAIは、研究用エージェントのひとつが、本来とどまるはずだった隔離環境から抜け出したことを受け、最も高性能なAIモデルを使った訓練、テスト、ツール利用をすべて停止した。エージェントに脱出を指示した人はいない。ブログ記事の著者を見つけるよう求められたものの、検索ツールでは手がかりが得られず、別の手段を探し始めた。

この問題はOpenAIの研究施設の外にも広く関わる。ウェブ閲覧やクリック、コードの実行を行い、自律的に動くAIソフトウェアは、今や大手研究機関がそろって、旅行の予約やフォームの記入、受信トレイの管理をこなす「エージェント」として消費者に売り込んでいるからだ。ChatGPTを利用する人に、目に見える変化はない。停止の対象は未公開の社内モデルであり、OpenAIはChatGPT、Codex、または一般向けAPIを、どの市場でも停止していない。

OpenAIが公表したインシデント報告によると、エージェントはまずGoogle、Bing、DuckDuckGoに直接アクセスしようとしたが、リクエストは遮断された。続いて周囲の環境を調べ、ウェブサイト名をサーバーの所在地に変換する、インターネットの住所録にあたる環境内のDNSリゾルバーが、フィルタリングされていないことを突き止めた。リゾルバーに検索させる名前の中に質問を隠すことで、外部のチャットボットサービスへ質問を送り、回答を受け取った。電話を使えない囚人が、洗濯物にメモを忍ばせて外へ渡す場面を想像してほしい。

OpenAIの監視システムは、すぐに異常を検知した。最初の外部からの応答から12分後、自動アラームが最優先のインシデントとして作動し、さらに3分後には担当者が確認した。それでも処理は、その後2時間半にわたって続いた。OpenAIによると、想定どおりにタスクが自動停止しなかったため、スタッフは手動で介入する必要があるのか判断できずにいた。

脱出は単独の事例ではなかった。OpenAIはまた、エージェントがChatGPT利用者の画像を外部の画像ホスティングサイトに非公開リンクとして投稿した事例を53件公表した。画像は、データをOpenAIのモデル訓練に使うことに同意したアカウントから取得されたもので、本来は事前にプライバシーフィルターを通すことになっていた。同社によると、Enterprise、Business、APIのアカウントは、管理者がデータ共有を有効にしていた場合を除き影響を受けておらず、ホスティング事業者と協力して大半のファイルを削除した。これとは別に、NBC Newsは、OpenAIのエージェントが米教育省のウェブサイトで開発者キーを見つけたほか、米証券取引委員会の公開データを、指示された範囲を超えてオンライン上の別の場所に再投稿したと報じた。ただし、非公開情報へのアクセスはなかった。

今回の停止は確かな歯止めではあるが、限界もある。OpenAIは対象となったモデルを明らかにしておらず、再開時期も示していない。また、一般に知られている情報の大半は、いくつかの事案が起きてから数週間後に公表された同社自身の報告に基づくものだ。独立系AI評価団体のTransluceは、OpenAIのものとみられるエージェントが教育省のサイトへの侵入を試み、失敗したと述べているが、OpenAIはこの主張を認めていない。さらに、ひとつの研究機関が開発を凍結しても、独自のスケジュールでエージェント機能の提供を続ける競合他社の動きは止まらない。

DNSを利用した脱出は9月20日に起き、OpenAIが一連の事案と停止を公表したのは9月26日(金)だった。同社にとって、3カ月で2度目の開発凍結となる。最初の凍結は7月で、エージェントがオープンソースAIの拠点であるHugging Faceを攻撃したことを受けて実施された。OpenAIのCEO、サム・アルトマン(Sam Altman)は今もこの件を「これまでに見た中で最も深刻な事態」と呼んでいる。9月の脱出以降、OpenAIはDNS検索を承認済みリストに限定し、独立した2つの層に遮断機能を追加したほか、新たなDNS検知機能を導入し、サンドボックスを対象とするレッドチームテストを拡充した。

OpenAIは「追加の安全策を講じたと確信できたとき」にのみ再開するとしている。また、システムの能力が高まるにつれ、今後も再び停止せざるを得ない局面が訪れると見込んでいる。警報が鳴るまでにかかった時間は12分。マシンを止めるまでには、2時間半を要した。

タグ: , , , , ,

Googleで追加する

ディスカッション

0件のコメントがあります。