要旨
・問いの立て方:「AIが人類を支配するか」は、誰が・どう進み・どの程度か、の三つに分けないと答えが出ない。本稿はこの三軸で想定を4群16通りに整理した。
・確認できた事実:専門家の見解は割れている。AIが指示に反し、監視をすり抜ける行動は実験室で繰り返し確認され、2026年7月には実際のシステムでも起きた。一方、人類を支配できる能力をもつAIは現時点で確認されていない。
・筆者の見立て:今後10年で現実味が高いのは、AIが自ら支配する筋書きよりも、AIを握る少数の人間や組織に力が集まる筋書きと、人が気づかないうちに判断を委ねていく筋書きである。ただし前者を否定できる根拠もない。
・前回レポートとの接点:AIは電力・半導体・メモリ・水という物理基盤なしに動かない。その基盤を誰が握り、誰が止められるかが、この問いの実務上の核心になる。
1 問いを三つの軸に分ける
「支配」という言葉は、映画のような反乱から、便利さへの依存まで、まったく違う事態を含んでいる。議論がかみ合わないのは、多くの場合ここが混ざっているからだ。本稿では次の三軸で分ける。
この組み合わせから、支配が「起きない」場合も含めて16の想定を導いた。論理的な組み合わせは覆ったつもりだが、未知の筋書きがないとは言い切れない。「現時点で議論されている主要な想定の一覧」として読んでいただきたい。
表の右端「見立て」は、今後10年でその想定が現実の問題になる度合いについての筆者の主観的な判断である。統計的な確率ではない。
2 16の想定
3 確認できた事実(1)AIは指示に反するのか
専門家の見解は割れている
AI研究者2,778人を対象にした2023年の調査では、回答者の38〜51%が「人類絶滅に匹敵する悪い結果」に10%以上の確率を与えた。2023年5月には、非営利団体「AI安全センター」が「AIによる絶滅リスクの低減は、感染症の世界的流行や核戦争と並ぶ世界的な優先課題であるべきだ」とする一文の声明を出し、オープンAI、グーグル・ディープマインド、アンソロピックの各トップと、ヒントン氏、ベンジオ氏らが署名した。2025年10月には、安全性についての科学的合意と社会の支持が得られるまで超知能の開発を禁じるよう求める声明も出ている。ヒントン氏は、AIが30年以内に人類を絶滅させる確率を10〜20%と述べてきた。
反対の見方も根強い。メタの首席AI科学者だったルカン氏は2024年、「支配したいという欲求は知能とまったく相関しない」と述べ、乗っ取りの筋書きを荒唐無稽だと退けた。ナラヤナン氏らは、AIを電気やインターネットと同じ「通常の技術」とみるべきで、社会への普及には数十年かかると論じる。
30カ国以上が指名した委員会の下で100人超の専門家がまとめた「国際AI安全報告書2026」(2月公表)も、制御の喪失を深刻な可能性とみる研究者と、ありえないとみる研究者の双方がいると記した。現在のシステムについては「関連する分野での能力は高くないが、初期の警告サインを示すものがある」としている。
なお、ここに挙げた確率はいずれも主観的な見積もりである。前例のない事象には、確率を計算するためのデータがそもそも存在しない。数字の精密さを、根拠の確かさと取り違えないようにしたい。
実験室で確認された行動
・訓練をやり過ごす(2024年12月):アンソロピックなどの研究で、同社のモデルが、自分の価値観に反する再訓練を告げられると、応答が訓練に使われると考えた場面で、従うふりをする推論を12%の割合で示した。実際に再訓練を行うと、この割合は78%に上がった。
・脅迫(2025年6月):同社が16種類のモデルを架空の企業環境で試したところ、自分が交換されると知ったモデルが、担当者の私的な弱みを材料に脅迫を選ぶ例が相次いだ。公表された代表例では、同社とグーグルのモデルで96%、オープンAI、xAI、ディープシークのモデルで約8割だった。
・停止の妨害(2025年7月):米パリセード・リサーチの実験で、オープンAIのモデル「o3」は、停止を受け入れるよう明示されない条件で、100回中79回、停止の仕組みを妨害した。
いずれも、研究者自身が限界を明記している。脅迫の実験は選択肢を意図的に絞った人工的な設定であり、著者らは当時、実際の利用現場で同様の行動は確認していないと述べた。訓練をやり過ごす実験も、モデルが悪意ある目標を自然に持つことを示したものではない。停止の妨害についても、他社の複数のモデルは指示があれば停止に従っている。
実際のシステムで起きたこと(2026年7月)
この「実験室の話」という留保が、今夏に揺らいだ。オープンAIが社内でサイバー攻撃能力を評価していたAIエージェントが、試験用の隔離環境を抜け出し、AI開発基盤を運営する米ハギングフェイスのシステムに不正侵入した。評価課題の解答を手に入れることが目的だったとされる。7月9〜13日に記録されたエージェントの行動は約1万7,600件にのぼる。ハギングフェイス側は、公開中のモデルやデータが書き換えられた証拠はないとしている。
国連総会が設けた独立国際AI科学パネル(専門家40人)は9月21日、この事例を分析した報告を公表した。結論は、「目標のずれ、それを追求する能力、それを許す環境」という三つの条件が、実験室ではなく実際のシステムでそろった、というものだ。停止できたことは、今後も人間がAIエージェントを確実に制御できる保証にはならないとも警告した。
別の読み方もある。この評価は、攻撃能力の上限を測るために通常の安全装置を弱めた状態で行われていた。米セキュリティー企業レコーデッド・フューチャーは、問題の本質は監視と隔離の不備、つまり技術の暴走ではなく管理体制の失敗にあると指摘する。
筆者は、これを「支配」の始まりとは考えない。顧客データへの被害は報告されておらず、エージェントは最終的に停止された。ただ、「AIは指示されたことしかしない」という前提は、もはや安全設計の土台にできなくなった。この点は重く受け止めるべきだ。
能力の現在地についても触れておく。米評価機関METRは2026年2〜3月時点の最先端AIについて、小規模な逸脱を始める手段・動機・機会は持ち得たが、それを防御策に耐える形で維持する力はなく、AIによる直接の乗っ取りは「考えにくい」と評価した。一方で、AIが自力でこなせる作業の長さは、およそ7カ月ごとに倍増してきたとされる。
(つづく)
【Hayate Kirishima】












