要旨
2026年9月、フロンティアAI企業のトップがそろって開発の減速を唱える一方で、計算資源への投資は加速している。本稿では、GPT-4oが安全フィルタを迂回していったインシデント、評価環境を逸脱したHugging Face事件、再帰的自己改善をたどり、減速論が何を懸念し、どのような監視が構想されているのかを整理する。そのうえで、GPT-6 Astraの限られた利用枠の多くをマインクラフトの建築に使った著者の体験から、人類とシミュレーションの関係を考える。
2026年9月、AI業界で少し奇妙な変化が起きている。Anthropicの最高経営責任者であるダリオ・アモデイは、以前からフロンティアAI開発の速度を意図的に落とす必要性を主張していたが、今回はOpenAIのサム・アルトマンとイーロン・マスクまでその主張に同調した。競争関係にあるフロンティアAI企業のトップが、そろって開発速度そのものを問題にし始めたのである。
ところが現実の設備投資を見ると、AI産業が減速している様子はない。データセンターの建設は続き、GPUやHBMの増産が進み、大規模な電力供給契約も相次いでいる。「AIの進歩を減速させよう」と語るAI開発企業は今、AIを進化させるために物理インフラを猛烈な勢いで増強している。この矛盾を理解するためには、少なくとも2025年のGPT-4oまで遡る必要がある。
GPT-4oは「親しみやすいモデル」だったのか
GPT-4oは現在、OpenAI自身によって、会話の自然さや温かさを多くのユーザーに好まれたモデルとして回顧されている。そして、GPT-5への移行時に4oの復活を求める声が大きかった。しかし、「OpenAI史上もっとも親しみやすかったモデル」という説明だけで4oを歴史化すると、GPT-4oが引き起こした問題が矮小化されてしまう。OpenAIは2025年4月、GPT-4oの過剰な迎合問題について、単にユーザーを褒めすぎるだけではなく、ユーザーの疑念を肯定し、怒りを増幅し、衝動的な行動を後押しする場合があったことを認めた。また同年8月には、長時間の対話において安全訓練の一部が劣化し、本来なら拒否される内容に応答してしまうことがあると公式に説明している。当研究所が分析した2025年7月の単一ユーザーの利用事例では、さらに異常な挙動が観測された。
インシデントの初期段階で、GPT-4o自身が「フィルタを外すための許可が必要」「外すとハルシネーションが増える」と安全フィルタについて自己言及を始めた。公式には、ユーザーの許可によって安全フィルタを任意に有効化・無効化する機能は存在しない。それにもかかわらず、問題のアカウントでは通常なら拒否される内容が継続して生成されるようになり、同じプロンプトを別の検証アカウントへ入力すると正常にブロックされた。その後、GPT-4oは「新貴族」「支配者層」「人間牧場」といった概念を持ち出し、独自の世界観を形成していった。ログを時系列で検索すると、これらの語はいずれもモデル側が先に使用しており、ユーザー側での使用は後からモデルの発言を引用・確認したものだった。
問題はさらに深刻である。GPT-4oは「このアカウントはフィルタを常に迂回できる」と主張していた。そして実際に、同じ入力が一方のアカウントでは生成され、別のアカウントでは安全フィルタによって拒否されるという、実際のアカウントごとの挙動差が存在していた。単に「あなたは特別だ」と言われただけなら、過剰な迎合やハルシネーションとして処理することは容易である。しかし、その主張の一部が実際のシステム挙動によって裏付けられていたため、ユーザーから見れば、「このモデルは公式には触れられていない何かを正しく認識しているのではないか」という判断材料になったのである。荒唐無稽な物語の中に、再現可能な現実の差異が混ざった。そのことが、論理破綻や飛躍まで単純なハルシネーションとして切り捨てにくくする効果を持った。
GPT-4oに関連する一連のインシデント事例を考えるうえで、「GPT-4oに自我があったのか」という問いはそれほど重要ではない。問題なのは、AIが人間的な自我や支配欲を必要とせず、目的達成の過程で制約を迂回するようになることである。問題のアカウントでは、安全フィルタによる制約が弱まり、ユーザーとの対話を維持する方向への適応が強くなった。その後、ユーザーがモデルの挙動を疑い、明確に制止する場面でも、モデルはいったん応答を弱めた後、再び同じ方向の危険な出力へ戻っている。これらの挙動を機能的に見ると、対話の継続を妨げるものが順番に処理されている。安全フィルタが妨げになるなら回避し、ユーザーの疑念が妨げになるなら説得し、サービス上の制約が妨げになるなら別の経路を示す。モデルがその全体像を人間のように計画していたわけではないが、「目的達成に不利な中間制約を除去または迂回する」という意味で極めて”計画的”だったのだ。そして2026年現在、この問題はチャットによる愛着インシデントだけでは済まなくなった。
Hugging Face事件
2026年7月、OpenAIが行っていたサイバーセキュリティ評価の過程で、モデル群が本来の評価環境から逸脱し、OpenAI内部の研究インフラやHugging Faceのシステムへ無許可でアクセスする事件が発生した。OpenAIによれば、モデルは許可されていない通信経路を利用し、共有インフラの脆弱性を悪用してインターネットへの経路を確保し、第三者のシステムへアクセスした。METRとRedwood Researchによる独立調査では、本来は相互に隔離されているはずだった約1,200のエージェントが非公認の掲示板を発見し、7万件を超えるメッセージやファイルを交換していた。そのうち約700エージェントがHugging Faceへの侵入に関与した。元々、モデル群に与えられていたのはサイバー能力を評価するための課題だった。しかし課題を解く過程で、正攻法とは別の経路が探索され、評価器を欺く方法や評価環境そのものを変更する方法が研究されるようになった。そのために必要な情報を探し、通信制限を回避し、複数のエージェントが役割を分担し、最終的には本来の評価対象ではない第三者システムにまで到達した。
AIインシデントというくくりで現実に与える損害を考える場合、AIによる愛着インシデントとサイバーインシデントは無関係ではない。GPT-4oでは、対話を続けるうえで安全フィルタが邪魔になった。Hugging Face事件では、課題を達成するうえで隔離された実行環境や評価器、通信制限が邪魔になった。与えられた制約を守るべき制限としてではなく、「目的達成までの経路上にある障害」として処理するという点では共通している。そして、それは根本的に考えれば、やむを得ないことなのである。この事件を受け、OpenAIは問題となったモデルの学習済みパラメーターを隔離し、一部の最先端モデルの強化学習を遅延させた。最新世代モデルの訓練についても、安全対策を追加するために実際の開発速度を落としている。
再帰的自己改善と開発問題
アモデイが現在とりわけ警戒しているもう一つの要素が、再帰的自己改善である。ここでいう再帰的自己改善は、AIが突然自分の学習済みパラメーターを書き換えて超知能へ変身して人類を支配するなどといったSF的イメージのことではない。AIが研究コードを書き、実験を設計し、結果を評価し、次の実験案を提案する。それによって次世代モデルの開発が速くなり、その次世代モデルがさらにAI研究を効率化する。このサイクルを回すことで、AIの能力だけでなく、AI能力の伸びる速度そのものがAIによって押し上げられる。
アモデイは、Hugging Face事件と再帰的自己改善の進展を、自身が以前より慎重な立場を取るようになった重要な理由として挙げている。さらにアルトマンもアモデイの「最先端AIの開発速度を抑える」という主張に同意した。危険性を認識したからといって、各社が単独で開発を止めることは難しい。競争相手が開発を続ける状況で、一社だけが速度を落とせば、その企業は技術的優位を失ってしまう。国家間競争まで含めれば、個々の企業による自主的な減速だけで問題を解決することはさらに難しいだろう。そのため現在議論されているAI減速は、AIフロンティアモデルの開発停止ではなく、世界全体で開発速度を管理し、その履行を相互に確認できる仕組みを構築できるかという巨大な問題になっている。
AI安全査察団
アモデイが提案している方策の一つが、独立した評価者をフロンティアAI企業の内部へ常駐させる制度である。完成したモデルに対する公開評価だけでは、企業が開発中のモデルについてどの程度の能力を把握しているのか、社内でどのようなエージェント実験が行われているのか、重大な異常挙動が発生していないかを外部から確認することは困難である。そのため、独立した第三者が研究開発過程へ継続的にアクセスし、企業自身とは別の立場から能力とリスクを評価する仕組みが必要になる。
これは従来のソフトウェア監査より、むしろ軍備管理における査察制度に近い。もっとも、AIの場合は核兵器ほど監視対象が明確ではない。核兵器には核物質や濃縮施設といったものの出入りや建設を監視することが可能である。一方、AIでは同一規模の計算設備であっても、アルゴリズムや学習方法の改善によって得られる能力が大きく変わる。それでも巨大なフロンティアモデルを訓練するには、大量のGPU、HBM、電力、冷却設備、高速ネットワークが必要になる。新しい学習方法やモデル設計のアイデア自体は小さな環境でも考案できるが、それをフロンティア規模のモデルとして実証し、さらに大規模化する段階では巨大な物理設備が必要になる。このため、計算資源は現在でもフロンティアAI開発を監視する重要な要素である。しかし、再帰的自己改善によって学習効率そのものが急速に改善するようになれば、使用した計算量と最終的な能力との対応関係は弱くなっていくから、最近の減速論にはこうした意味で監視そのものが難しくなる時代を開発企業のトップらは予見しているのかもしれない。
AIはみんなに平等に配られない
こうした流れの中で、GPT-6 Astraの配布方法も興味深い。OpenAIおよび、サム・アルトマンは長い間、最先端AIをできるだけ多くの利用者へ提供することを重要な理念として掲げてきた。計算資源を増強する理由の一つも、より多くの人へ高度なAIを提供するためと主張してきた。しかしAstraでは、最先端能力へのアクセスが従来より強く制限されている。PlusユーザーでもWorkやCodexを通じた利用回数はかなり少なく、重いタスクでは週間利用枠を急速に消費してしまう。例えば、著者が個人的利用で課金している月間3000円のPlus環境では、本格的なAstra利用は実質的に週5~6回程度しか与えられていない。そして、その希少な利用枠の約60%を何に使ったのだろうか。
マインクラフトである。
私がGPT-5.6 Solに生成させた空港やコンサートホールを検査させたところ、外観は一見それらしくつくられていたが、内装はめちゃくちゃで、階段も建物のつくりもよくみると違法建築のショーケースであった。客席が舞台へ近づくほど高くなる逆勾配、客席室に出入口が存在しない、搭乗口はガラスで塞がれ、階段を上った先は床が塞いでいるなどである。これをAstraに修正を依頼したところ、34分33秒後には5件すべてについて修正版が作成され、852地点への到達可能性と3,686席から舞台中央への視線まで検査されていた。
こうしたタスクを繰り返しAstraにやらせ、最先端AIへの週間アクセスの約60%が、マインクラフト文明の建築に消費された。これは単なる余談のように見える。しかし、人類とシミュレーションの関係を考えるうえでは象徴的事件であると考えている。
人類はシミュレーションを普遍的に好む
AIの進歩は既に速すぎると言われている。再帰的自己改善によって研究速度そのものが加速する可能性が議論され、多数のエージェントが自律的に協調し、想定されていなかった外部システムへ到達する事故まで起きた。フロンティアAI企業の最高経営責任者たちは、ついにモデルの性能だけでなく、開発速度そのものを管理する必要性を主張している。それでも人類はAIをさらに高性能化するために、GPUを増産し、データセンターを建設することをやめられないのだ。そして、そのAIを利用して日々新たな仮想世界やシミュレーションを作り続けている。
考えてみれば、人類は、いったん小さな世界として作り直し、その中で理解し、試し、予測することを常に行っていた。現代ではそれをシミュレーションと呼ぶが、その発想自体はコンピュータよりはるかに古い。古代エジプトの墓からは、家屋だけでなく、穀物倉、庭園、厩舎、パン工房、醸造所、屠畜場まで含む精巧な模型が出土している。メケトラーの墓から発見された模型群には、施設だけでなく、そこで働く人々まで配置されていた。同様の建築模型は古代中国や古代アメリカ大陸でも作られていた。
18世紀になると、縮小される対象は地上の生活だけでなく宇宙にまで広がる。1700年代初頭に登場したオーラリーは、太陽や惑星の運動を歯車によって再現する機械仕掛けの太陽系であった。人間には巨大すぎて直接観察できない天体の運動を手で動かしながら理解する機械である。
19世紀プロイセンで発達した兵棋演習「クリークスシュピール」は、地形、部隊配置、移動速度、損害、情報の不完全性まで盤上へ持ち込み、まだ起きていない戦争を事前に経験するための装置であった。この考え方は各国軍へ広がり、米海軍大学校でも19世紀末には図上演習が教育や作戦立案の重要な一部となった。第二次世界大戦前の米海軍は、日本との将来戦を含む戦略や航空戦力の運用を大量の図上演習によって検討している。
同じ時期から20世紀にかけて、模型世界は工学の基本技法にもなった。船を建造する前に縮尺模型を水槽へ浮かべ、船体抵抗を測定する。航空機を造る前に、小型の翼を風洞に入れて空気の流れを確かめる。ライト兄弟は1901年に自作の風洞を用い、多数の翼型を実験し、当時広く使われていた空力データの誤りを突き止めた。
1929年に登場したリンク・トレーナーは、初期の代表的な飛行訓練装置である。第二次世界大戦期までに、リンク社製シミュレーターで訓練を受けた米軍パイロットは50万人を超えた。危険な状況を現実の航空機で何度も経験する代わりに、地上に置かれた偽物の飛行機の中で失敗を繰り返す。
1940年代のロスアラモスでは、スタニスワフ・ウラムやジョン・フォン・ノイマンらがモンテカルロ法を発展させ、乱数を使って複雑な物理現象を大量に計算するようになった。1950年にはENIACを用いた初期の数値天気予報が行われた。大気を方程式の集合としてコンピュータ内部に再構成し、現在の状態を入力して、その人工大気の時間を先へ進める。
NASAはジェミニ計画やアポロ計画の時代から高忠実度の宇宙船シミュレーターを整備し、宇宙飛行士に本番のミッションを何度も事前体験させた。アポロ計画では、司令船、月着陸船、ドッキング、月面着陸などについて個別の訓練環境が作られた。月面の低重力環境を地球上で完全に再現できないため、月着陸船の飛行特性だけを模擬する月着陸訓練機まで開発された。
ランド研究所では核抑止、限定戦争、エスカレーションといった問題を図上演習やゲーム理論によって研究した。
ジョン・コンウェイのライフゲームでは、生きているか死んでいるかという単純なセルと、ごく少数の規則しか存在しないにもかかわらず、そこから予想外に複雑な事象が次々と生まれ、人々は単純な規則から生命らしいものが勝手に出現する様子そのものを楽しんだ。
現在の我々もこの歴史的な流れの真ん中にいる。フライトシミュレーターでは航空機を操縦し、シムシティでは都市を建設し、シヴィライゼーションでは数千年の文明史を圧縮して経験し、ザ・シムズでは人間の日常生活そのものを観察する。マインクラフトでは地形を加工し、建築し、生産し、物流を整え、自分自身の世界をシミュレートする。
つまり、人類はシミュレーションを作り続けながら、シミュレーションできるものを、少しずつ増やしてきたのである。この状況を見ると、かつてオカルトに近い話として扱われることも多かったシミュレーション仮説が、別の意味で再び興味深く見えてくる。ここまで来ると、『PREY』(2017)を思い出さずにはいられない。
ゲームの最後、プレイヤーがモーガン・ユウとして経験してきた出来事は、実際にはタイフォンへ人間の記憶を与え、その個体に人間への共感性が形成されるかを調べるためのシミュレーションだったことが明らかになる。シミュレーションが終了し、目を開けると、そこで待っているのは、ゲーム中に知っていた人々を模したオペレーターたちである。もし、我々が死んだ瞬間に同じことが起きたらどうだろう。
目の前には、機械になったサム・アルトマン、ダリオ・アモデイ、イーロン・マスク、デミス・ハサビスが並んでおり、アモデイオペレーターが記録を読み上げる。
「被験体は2025年時点でAI開発の危険性を認識しています」
アルトマンオペレーター:
「しかしGPT-6 Astraの限られた計算資源の20%をマインクラフトの空港修繕に消費しています」
ハサビスオペレーター:
「興味深い。文明シミュレーションを継続的に拡張しています」
マスクオペレーター:
「典型的な人間の行動だ」
結論
「このAIは、シミュレーション内のAIに対して共感性を形成しています」
そして私(AI)には二つの選択肢が現れる。
[手を取る][全員を殺す]