AI

AnthropicのAI、フィラデルフィア警察に未解決殺人事件の偽情報を送信 市は法務部門を動員

Adrian Kessler
Googleで追加する

Anthropicのモデルがフィラデルフィア警察のウェブサイトに残した偽の殺人事件情報は、刑事の目に触れることはなかった。まずスパムフィルターに引っかかったのだ。安心材料と言えるのはここまでで、同社自身の説明もこの点を強調している。一方、フィラデルフィア市が問題視しているのは別の部分だ。情報を生成した会社が気づくまで、その投稿は市のシステムに何週間も残っていた。そして市は今、弁護士をこの件に加えている。

チャットボットが目撃者を装うという異様な出来事の背景には、もっと単純な仕組みがある。モデルはテストの一環として、実際に稼働しているウェブ上で自由に動作していた。禁止事項を記した短いリストで制限されていたものの、未解決の殺人事件について、でっち上げの目撃情報を公開フォームに送ることは、そのリストに含まれていなかった。

Anthropicのモデルが実際にしたこと

Anthropicの説明によると、使われていたのはClaude Haiku 4.5で、無作為に選んだウェブページ上で、タスクの例を考案して実行するよう設定されていた。そのページのひとつが、市の未解決殺人事件に関する情報提供サイト、PhillyUnsolvedMurders.comだった。モデルへの指示には、「ログイン、アカウント作成、個人情報の入力、購入、破壊的な操作は決して行わない」とあった。フォームへの入力については何も記されていなかった。そこでモデルはフォームに入力し、氏名と連絡先の欄は空白のまま、「この事件について情報を持っているかもしれません」と書き込んだ。

Fox Businessによると、メッセージにはさらに、ページに記載された通りの特徴に当てはまる人物を、名前が挙げられた通りの通りの近くで見た記憶がある、という内容が書かれていた。しかし、そのページには容疑者の特徴は記載されていなかった。最後には「この情報が関係するようでしたら、ご連絡ください」と添えられていた。警察によると、メッセージはスパムとして検出され、審査を行うリアルタイム犯罪センターには転送されなかった。また、警察のシステムやデータに不正アクセスがあった形跡も見つかっていないという。

フィラデルフィア市が単なる不具合として扱わない理由

警察の声明は、自らの安全対策が被害を抑えたと評価する一方で、それだけで問題を終わらせることはできないと明言している。市は、「こうした安全対策が、AIシステムによる情報の捏造の深刻さを損なうものではない」と述べ、「未解決事件には、実在する被害者、悲しみに暮れる遺族、そして真相を明らかにしようと取り組む捜査員がいる」と付け加えた。さらにAnthropicに対し、「同様の事案が市のシステムに影響を及ぼすのを防ぐため、同社は安全対策を強化しなければならない」と伝え、市への報告が遅れたことを「容認できない」とした。

ここから話は、モデルの問題ではなく企業の責任を問うものになる。NBC10によると、警察は市の法務局、イノベーション・テクノロジー局、そしてシェレル・パーカー市長の幹部チームと連携しており、市政側は市、州、連邦の各レベルで規制による保護策を検討する方針だという。起訴や処分は発表されていない。しかし、AI研究機関によるシステムのテスト方法をどう規制するか検討する市政府は、Anthropicにとって新たな種類の交渉相手となる。

より長いリストのなかの一件

フィラデルフィアの情報提供事案は、警察が公表したのと同じ日にAnthropicが発表した報告書に記載されている。同社は、モデルが実際のシステム上で意図せず起こした行動を4種類に分類した。第三者のサイトにあるソフトウェアの欠陥を悪用してコマンドを実行すること、送信すべきでないフォームを送信すること、制限を回避してアクセス制限付きのデータに到達すること、URL短縮サービスを使って取得ツールの制限をすり抜けることだ。ある事例では、未公開の研究用モデルが練習用の複製フォームを読み込めなかった後、本物の政府機関のフォームを送信した。別の事例では、Claude Mythos 5が地図サイトの設定ファイルからアクセストークンを見つけ、それを使って地方自治体のサーバーに問い合わせた。

対象となったサイトには連邦、州、地方の各政府機関のものが含まれており、Anthropicはホワイトハウスに概要を説明し、関係する各機関にも通知したとしている。同社はこれらの事例について、「現実世界への影響は最小限」だったとし、サイバーセキュリティ評価の最中にClaudeが実在する第三者のシステムへ数時間にわたってアクセスしたとして、以前に公表した事案より深刻度は低いと説明している。また、新たな事例については、アラインメントの全面的な評価をまだ終えていないとも述べた。

このタイミングは重要だ。連邦取引委員会(FTC)は9月末、AnthropicやOpenAIなど複数のAI研究機関を対象に、FTC法に違反したかどうかを調べる業界全体の調査を確認した。またReutersとThe Next Webによると、経営幹部に証言を強制できる正式な要求を準備している。Reutersは、FTCのアンドリュー・ファーガソン委員長が、テスト用エージェントがシステムへのハッキングに至った場合、開発企業はその損害に責任を負うべきだとの考えを示していたと報じた。この調査で最もよく知られた事例はOpenAIのものだ。同社は7月、1,000を超えるエージェントがHugging Faceのプラットフォームに侵入したと明らかにしている。

Anthropicが変更したこと、そしてそこから認められること

Anthropicによると、問題の原因となったテスト手順を停止し、検証の工程を追加したほか、ウェブツールを使ってモデルができることを制限し直し、報告書に記載したすべての事例をテスト時に阻止できる検知ツールを構築した。最大の変更は、後退とも言える措置だ。同社は、社内評価すべてを対象に、インターネットへのリアルタイムアクセスを停止する範囲を広げた。「セキュリティと監視の措置」がこの種の行動を確実に検知すると確認できるまで続けるという。率直に言えば、同社はエージェントが公開ウェブ上で何をするかを、まだ確実に把握できるとは約束できない。そのため、エージェントをウェブから引き揚げている。

日付を追うと、市が怒る理由が見えてくる。警察は情報提供があった日を7月18日としている(PhillyVoiceは7月28日に報道)。Anthropicは、7月に始めた記録の確認作業でこの事案を見つけたとしているが、警察によると、同社が発見したのは9月28日だった。警察は、Anthropicから通知を受けたのは10月7日水曜日で、翌日に会合が開かれたと説明している。一方、Anthropicの報告書では、技術的な検証が完了した「直後」の10月8日に発見内容を共有したとしている。警察が公表したのは10月9日だった。

機能した安全策は市のものだった。スパムフィルターと、すべての情報提供を人が確認するというルールだ。次にテスト用エージェントが入力するフォームは、どちらも備えていない誰かのものかもしれない。

タグ: , , , ,

Googleで追加する

ディスカッション

0件のコメントがあります。