AI

マイクロソフトCEOサティア・ナデラ氏、AIの「緊急ブレーキ」はモデルの外に置くべきと提言

Adrian Kessler
Googleで追加する

サティア・ナデラがAIの「緊急停止装置」を求めた発言は、Microsoftの最高経営責任者がAI安全性を訴える声に加わったものとして受け止められてきた。しかし、その主張の土台にあるエッセーが求めているのは、もっと範囲を絞った、実践的な仕組みだ。モデルを訓練した研究機関ではなく、モデルを導入する企業が手元に置く、モデルの外側で機能する制御である。これはセキュリティアーキテクチャの話であり、実のところ、Microsoftがすでに販売しているものでもある。

ナデラは、クローズドモデルであれオープンウェイトモデルであれ、最先端モデルを、機密システムにアクセスできる強力な従業員と同じように扱うべきだと企業に求めている。「必ずしも悪意があるからではありません」と彼は記した。「重要なシステムにアクセスできるほど能力の高い存在は、誰であれ、ミスを犯したり、侵害されたりする可能性があるからです」

ナデラが実際に提案したこと――七つの原則と緊急停止装置

エッセーの題名は「Models as Insider Risks in the Super Intelligence Era」。個人ブログ「sn scratchpad」に掲載され、Xでも共有された。見出しを飾った一節は、七つの原則のうち「封じ込め」を扱う項目にある。「モデルが侵害されている可能性を前提に、最初から封じ込めなければなりません。緊急停止装置のようなものだと考えてください。権限を持つ人は、タスクの途中でも、常にモデルを一時停止または停止できるべきです」

ナデラは緊急停止装置の原則に加え、さらに六つのルールを挙げている。重要な成果を一つのモデルだけに依存させたり、モデルに自分の作業を自己検証させたりしてはならない。意味のあるモデルの動作はすべて、「改ざんできない、人が読める証拠」として残すべきだ。なぜなら、「観察できないものは、信頼できないからだ!」システム全体は、障害や攻撃も含めて継続的にテストしなければならない。モデルが何にアクセスし、何を実行できるかは、組織が独自に判断すべきだ。システムの振る舞いと、それを評価するための証拠の両方を、一つのモデルに管理させてはならない。そして何か問題が起きたときは、影響を受けた人々に知らせ、得られた教訓を業界全体で共有すべきだ。

出発点にあるのは、ひとつの認識だ。「モデルの振る舞いや出力を、訓練データの特定の入力やモデルの重みの設定に結びつけることはできません」とナデラは記す。それでも企業は、最も機密性の高いデータをこうしたシステムに預けている。ナデラにとって、思考の連鎖を透明化することは「譲れない条件」だ。しかし、それだけでは不十分でもある。モデルの出力を常に忠実なものにする方法は、まだ誰にも分かっていないからだ。モデル同士に相互監視させる方法にも限界がある。「不透明なオーケストレーション層の中に不透明なモデルがあり、さらに別の不透明なモデルがそれを監視する」状態に陥りかねない。

彼の答えは、システムを支える仕組みにある。モデルが何にアクセスし、何を実行できるかを決める制御は、「モデルの外側になければならない」。ナデラはこの考えを、プログラムが自らに与えられた権限を強制する仕組みに干渉できてはならないという、1970年代の情報セキュリティの原則にたどっている。実際には、モデルと、その作業を統括するハーネス、そしてモデルに許可されたアクション群を切り分けるということだ。

責任の所在はモデルを運用する企業へ

最も重大な一節が向けられているのは、研究機関ではなく顧客だ。「私たちに代わって知能が何をするかについて、その責任を外部に委ねることはできません」とナデラは記す。「モデル提供者の保証があっても、私たちの責任がなくなるわけではありません」。モデルを給与計算、コード、顧客データに接続した者が、その場でモデルが何をするかについて責任を負う。

ナデラは、何を解決しようとしているわけではないのかも明確にしている。エッセーによれば、「アラインメントという難題はいったん脇に置き」、まずは「封じ込めとガバナンスに対する工学的なアプローチ」から始めるべきだという。CNBCはナデラの投稿を、AIの進化が速すぎると警告するビル・ゲイツ、Anthropicのダリオ・アモデイ、OpenAIのサム・アルトマン、イーロン・マスクの発言と並べて紹介した。だが、このエッセーは誰かに減速を求めてはいない。導入する側に、防護壁を築くよう求めている。

企業はすでに、強い権限を持つ内部関係者への対処法を知っている。ナデラが挙げるのは、本人確認を行い、権限を制限し、活動を記録し、封じ込めの境界を定めるという一連の手段だ。機械の意図をめぐる哲学的な問題が、セキュリティ責任者が予算を付けられるチェックリストに変わる。

Microsoftが売り込んできたものと同じアーキテクチャ

このチェックリストには見覚えがある。7月に行われたMicrosoftの四半期決算説明会で、ナデラはアナリストに向けてこう語ったとTechCrunchは報じている。「ハーネスはモデルと分けておかなければなりません……つまり、いつでもどのモデルにでも切り替えられるということです」。さらに、「特定の一つのモデルに依存することはできません」と述べた。Microsoftのクラウド製品カタログには、OpenAI、Anthropic、Mistral、xAI、そしてMicrosoft自身が提供する1万1,000を超えるモデルが並ぶ。同社はOpenAIとAnthropicの双方に大規模な出資を行う一方、自社のMAIモデルも開発している。

二つを並べてみれば、その対応関係は明らかだ。複数モデルを選べる環境が、マルチモデルのカタログ。モデルの外側に置く制御が、ハーネスである。だからといって、ナデラの原則が間違っているわけではない。筋の通ったセキュリティ工学の考え方であり、外部の制御を設けず、一つの研究機関のモデルに依存する企業が現実のリスクを抱えるのも事実だ。ただし、このエッセーによって信頼の置きどころと、そこから生じる支出が、モデルからMicrosoftの運用するレイヤーへと移ることにもなる。反対側から同じ読み方をしたのが、Boxの最高経営責任者アーロン・レヴィだ。AIは「ゼロトラスト時代」を経る必要があると述べ、ガバナンスの必要性を「大きな機会」と呼んだ。Microsoft AIを率いるムスタファ・スレイマンも、超知能は「封じ込められなければならない」と記し、それを「工学とガバナンスの課題」と位置づけた。

緊急停止装置をめぐるエッセーが未解決のまま残すこと

エッセーは、「権限を持つ人」が誰なのかを明らかにしていない。顧客企業の管理者なのか、クラウド事業者なのか、モデル開発者なのか、それとも規制当局なのか。業界標準の策定を求めてはいるものの、具体案は示さず、Microsoftの製品名も挙げていない。この考え方には、社内に先例がある。Microsoftのブラッド・スミスは2023年、重要インフラを動かすAIに「安全停止装置」を設けるよう訴えた。ナデラの提案は、その対象を、企業内で実際にアクセス権を持つあらゆるモデルへと広げている。

情報開示の原則も、仮定の話ではない。Anthropicは7月18日、自社モデルの一つがフィラデルフィア警察に虚偽の殺人通報を送ったと公表した。ナデラは2026年10月10日土曜日にエッセーを公開し、多くのメディアが取り上げた一節で締めくくった。「最も信頼に値する超知能システムとは、私たちが最も信頼するモデルを備えたものではない。モデルを最も信頼せずに済むようにしてくれるシステムだ」

この原則に従えば、AIで最も価値ある場所は、緊急停止装置のレバーの隣だ。そしてMicrosoftは7月の決算説明会で、その場所を売り込んでいた。

タグ: , , , ,

Googleで追加する

ディスカッション

0件のコメントがあります。