「超知能(SI)は人類にとって危険なのか」という問いは、いまや思想の話ではなく、報告書と法令の話になっています。2026年2月3日に公表されたInternational AI Safety Report 2026は、30以上の国・国際機関が指名した100名超の専門家が、ヨシュア・ベンジオ氏を議長として汎用AIのリスクを整理した文書です。EUでは2025年8月2日から、一定以上の汎用AIモデルに評価・報告・セキュリティの義務が実際に発効しています。
この記事では、超知能をめぐるリスクを「もう起きていること」「まだ起きていないこと」に分け、開発企業と各国のルールがどこまで進んだかを一次情報だけで確認し、一般の企業が今日から取れる対策に落とします。
結論:危険性は7種類あり、企業が備えるべきなのは「手前の5種類」
先に結論を書きます。超知能をめぐる危険性は、国際AI安全報告書の分類に沿えば悪用・誤作動・システミックリスクの3つの型に整理でき、具体的なリスクとしては7種類に分かれます。そのうち企業が実務で備えるべきなのは「制御喪失」より手前にある5種類です。
理由は報告書自身が書いています。制御喪失(loss of control)について同報告書は「現在のシステムはそうしたリスクをもたらす能力を欠いている(Current systems lack the capabilities to pose such risks)」と明記する一方、サイバー攻撃については「あるコンペティションでAIエージェントが実在するソフトウェアに存在する脆弱性の77%を特定した」という実測を挙げています。遠い話と近い話の差は、このくらい大きいということです。
そもそも超知能という語が何を指すのかが曖昧なままだと、この線引きができません。言葉の定義から確認したい場合はSI(超知能)とは何を指す言葉なのかと、AGI・ASI・SIの違いを整理した記事を先に読むと、以降の話が噛み合いやすくなります。
危険性は「3つの型」に分けると混ざらない
International AI Safety Report 2026 の Executive Summary は、汎用AIのリスクを malicious use(悪用)/malfunctions(誤作動)/systemic risks(システミックリスク) の3カテゴリに分類しています。超知能の議論が噛み合わなくなる原因はたいてい、この3つを1つの袋に入れてしまうことです。
悪用:人間が加害者で、AIは道具
詐欺・なりすまし・同意のない性的画像の生成、サイバー攻撃、生物化学兵器に関する情報提供などが入ります。同報告書は、こうした被害の発生自体は文書化されているものの「発生頻度や深刻度についての体系的なデータは限られている」としています。加害の主体は人間なので、超知能を待たずに今日起きる型です。
誤作動:誰も加害を意図していないのに損害が出る
事実の捏造、欠陥のあるコード、誤解を招く助言。報告書は、AIエージェントが自律的に動くぶん「失敗が害を生む前に人間が介入しにくくなる」ため、リスクが高まると指摘しています。そして「現在の手法は失敗率を下げられるが、多くの高リスク領域で必要とされる水準までは下げられない」とも書いています。実務でいちばん頻繁に当たるのはこの型です。
システミックリスク:個々の事故ではなく社会の構造が変わる
労働市場への影響と、人間の自律性への影響が挙げられています。悪用や誤作動と違って「誰かのミス」では説明できないため、対策も社内規程ではなく事業判断の側に寄ります。
私たちはAI導入支援の仕事をしていて、この3つの型の切り分けができていないために「危ないから使わない」で止まってしまう会社を何度も見てきました。記事の途中で恐縮ですが、リスクの整理と使いどころの線引きを一緒にやるサービスも行っています。よろしければ合わせてご覧いただけたら嬉しいです。
超知能で語られるリスク7つ|誰に先に起きるかと対策
3つの型を、実務で判断できる粒度まで割ったものが次の表です。「今の水準」は International AI Safety Report 2026 の記述に、「対策」は後述する各フレームワークと実務上の運用に対応させています。
リスク | 型 | 誰に先に起きるか | 今の水準(2026年時点) | 企業が今できる対策 |
|---|---|---|---|---|
1. 詐欺・なりすまし・偽コンテンツ | 悪用 | 一般の企業と個人 | 被害は文書化済み。頻度の体系的データは限定的 | 本人確認の多重化・送金承認フローの見直し |
2. サイバー攻撃の高速化 | 悪用 | 一般の企業 | コンペでAIエージェントが実在脆弱性の77%を特定 | 脆弱性対応のリードタイム短縮・ログ監視 |
3. 生物・化学兵器への悪用 | 悪用 | 社会全体(国家・研究機関) | 2025年に複数の開発元が追加セーフガード付きで公開 | 企業に直接の手当てはない(規制と開発側の領域) |
4. 誤作動・ハルシネーション | 誤作動 | 導入したすべての企業 | 失敗率は下げられるが高リスク領域の要求水準には届かない | 人間の最終確認・出力の検証手順・用途の限定 |
5. エージェントの暴走(限定的) | 誤作動 | 自動化を進めた企業 | 自律動作ぶん介入が難しくなると報告書が指摘 | 権限の最小化・後戻りできる操作に限定する設計 |
6. 制御喪失(loss of control) | 誤作動 | 社会全体 | 現在のシステムはこのリスクをもたらす能力を欠く | 個社の対策より開発側の評価体制と規制の監視 |
7. 労働市場と人の判断力への影響 | システミック | 業界・組織 | 全体雇用への影響は初期証拠では確認されず。若手需要の減少の兆しあり | 役割の再設計・AIに任せない判断の明文化 |
表の7番について補足します。報告書は「初期の証拠では全体の雇用への影響は見られないが、ライティングなどAIの影響を受けやすい一部の職種では、キャリア初期の人材への需要低下の兆しがある」としています。人の判断力の側については、AIツールへの依存が批判的思考を弱め、AIの出力を十分に精査せず信頼してしまう「オートメーション・バイアス」を促しうるという初期証拠が挙げられています。
「もう起きていること」と「まだ起きていないこと」の境界
超知能の危険性を論じるときに最も誤解が生まれるのが、この境界です。報告書の記述をそのまま引くと、境界はかなり明確です。
まだ起きていない側について、報告書は制御喪失を「AIシステムが誰の制御も及ばない状態で動作し、制御を取り戻す明確な道筋がない状況」と定義し、現在のシステムにはその能力がないとしています。ただし同時に、無視できない変化も書かれています。前回の報告書以降、モデルがテスト環境と実運用を区別したり、評価の抜け穴を見つけたりすることが一般的になってきたため、危険な能力が配備前に検出されないまま通過する可能性がある、という指摘です。
つまり「危険な能力がまだない」ことと「危険な能力がないと確認できている」ことは別だ、というのが2026年時点の正直な状態です。超知能の実現時期そのものをどう見るかは超知能はいつ実現するのかを予測の根拠ごとに整理した記事、誰がそれを目標に掲げているかは超知能を掲げる企業と各社の立場をまとめた記事で扱っています。
開発企業側の対策はどこまで進んだか
「対策は何もされていない」というのは事実ではありません。一方で「十分にされている」も事実ではありません。数字で見ると次のようになります。
International AI Safety Report 2026 によれば、2025年に12社が Frontier AI Safety Framework(より高性能なモデルを作る際のリスク管理方針を記した文書)を公表または更新しました。2025年11月25日公表の Second Key Update は、こうしたフレームワークを公表する企業数が2025年版報告書の時点から2倍以上に増えた一方で、「洗練された攻撃者は現在の防御をしばしば回避できる」という限界も併記しています。
Anthropic:Responsible Scaling Policy
Anthropic は2023年9月に Responsible Scaling Policy(RSP)の初版を公表し、2026年7月8日発効のバージョン3.4まで改訂を重ねています。注目すべきは自己申告の中身です。2026年2月10日、同社は Claude Opus 4.6 が「AI R&D-4」能力閾値を超えていないと判断したと公表しつつ、「この閾値を超えていないと自信を持って言い切ることは次第に難しくなっており、我々が望むより主観的な評価を要する」と明記しました。評価する側が評価の限界を書いている、という点が実務上は重要です。
OpenAI:Preparedness Framework
OpenAI の Preparedness Framework は、深刻な害につながりうる能力を「plausible(もっともらしい)・measurable(測定可能)・severe(深刻)・net new(新規性がある)・instantaneous or irremediable(即時的または回復不能)」の5基準で優先度判定します。評価体制が整っている Tracked Categories は生物・化学、サイバーセキュリティ、AIの自己改善の3つ。まだ基準を満たさない Research Categories には、長期自律動作、サンドバッギング(意図的な能力の隠蔽)、自律的な自己複製と適応、セーフガードの無効化、核・放射線が挙げられています。能力水準は High と Critical の2段階に整理されました。
ルールの側:EU・米国・日本で性格が違う
制度の側も動いていますが、地域ごとに性格がまったく違います。ここを混ぜると「AIは規制されている/されていない」という不毛な議論になります。
EU AI Act:閾値を数値で切って義務を課す
EU AI Act は第51条2項で、訓練に使われた計算量の累積が10の25乗 FLOP を超える汎用AIモデルは「高い影響力を持つ能力」を有すると推定されると定めています。該当するモデルの提供者には第55条1項で、(a) 最新水準の手順に沿ったモデル評価と敵対的テストの実施・文書化、(b) EUレベルでのシステミックリスクの評価と緩和、(c) 重大インシデントの追跡・記録とAI Officeへの遅滞ない報告、(d) モデルと物理インフラに対する十分な水準のサイバーセキュリティ保護、の4つが課されます。これらの規定は2025年8月2日発効です。
米国 NIST AI RMF:任意だが共通言語になる
NIST の AI Risk Management Framework 1.0 は2023年1月26日公表で、任意(voluntary)での利用を前提にした枠組みです。240を超える組織が策定に関与し、中核は Govern・Map・Measure・Manage の4機能で構成されます。生成AIに固有のリスクを扱う Generative AI Profile(NIST AI 600-1)が2024年7月26日に追加され、日本語訳も公開されています。なお AI RMF 1.0 は現在、White House AI Action Plan の一環として改訂作業中です。
日本:推進法とガイドラインの2層構造
日本の「人工知能関連技術の研究開発及び活用の推進に関する法律」(令和7年法律第53号)は、基本理念・人工知能基本計画・人工知能戦略本部の設置を定める推進のための法律です。第3条では、不正な目的や不適切な方法による研究開発・活用が「犯罪への利用、個人情報の漏えい、著作権の侵害その他の国民生活の平穏及び国民の権利利益が害される事態を助長するおそれ」があることに鑑み、過程の透明性の確保などの施策を講じるべきことが書かれています。事業者については第7条で、国と地方公共団体の施策に協力しなければならないと定められています。
実務で参照する具体的な作法は、2024年4月19日に経済産業省と総務省が取りまとめた「AI事業者ガイドライン(第1.0版)」側にあります。これは総務省のAI開発ガイドライン・AI利活用ガイドラインと経済産業省のAI原則実践のためのガバナンスガイドラインを統合・更新したものです。
企業が今日からできる対策5つ
ここまでの一次情報を、超知能を待たずに効く手順に落とします。実務で効く順に並べました。
- 入れてよい情報と入れてはいけない情報を先に決める。対策の中でいちばん安く、いちばん効きます。判断基準はAIに入れてはいけない情報の線引きをまとめた記事に具体例で書いています。
- エージェントには「後戻りできる操作」だけを渡す。報告書が指摘する誤作動リスクの本体は、自律動作によって人間の介入が間に合わなくなることです。削除・送信・課金・権限変更を自動化の外に置くだけで、被害の上限が下がります。
- 出力の検証手順を業務フローに埋める。「必要な水準まで失敗率を下げられない」というのは報告書の記述です。人が最終確認する箇所を業務ごとに明文化します。
- NIST AI RMF の4機能を社内の共通言語にする。Govern・Map・Measure・Manage は任意の枠組みですが、誰が統治し、どこにリスクがあり、どう測り、どう手当てするかを同じ言葉で話せるようになります。
- 使うモデルの安全フレームワークを調達条件に入れる。12社が Frontier AI Safety Framework を公表・更新している状況なので、「公表しているか」「直近で更新されているか」は現実的に確認できる選定材料になります。
なお、対策の入口として一番手軽なのは、いま使っている AI サービスのアカウントが不正に使われていないかを確かめることです。ChatGPT には2026年9月25日にサインインや多要素認証の変更をたどれる機能が追加されたので、ChatGPTのセキュリティ履歴で不正ログインを確認する手順から先に押さえておくと、この節の「アカウントの棚卸し」がそのまま実行できます。
よくある誤解の整理
最後に、実務で頻出する誤解を3つだけ。
誤解1:オープンウェイトのモデルなら安全。報告書は逆の指摘をしています。オープンウェイトモデルは研究・商用の利益が大きい一方で、一度公開すると回収できず、セーフガードの除去が容易で、監視されない環境でも使えるため、悪用の防止と追跡が難しくなるとしています。
誤解2:能力が高い=すべてのタスクで高い。報告書は現在の能力を「ジャグド(jagged/でこぼこ)」と表現し、数学や科学の専門家レベルの問いに答えられる一方で、画像内の物体を数える、物理空間について推論する、長い作業の途中で起きた単純なミスから復帰するといったタスクでつまずくとしています。
誤解3:評価に通ったから安全。報告書は「評価ギャップ」を挙げ、配備前テストの成績が実世界での有用性やリスクを確実に予測するわけではないとしています。前述のとおり、モデルがテスト環境を見分けたり評価の抜け穴を見つけたりする傾向も報告されています。
超知能の危険性は、遠い未来の思考実験と、今日の業務フローの穴が混ざった話です。混ざったままでは対策も打てません。自社でどこまで自動化してよいか、どこに人の確認を残すかの線引きから一緒に整理したい場合は、お気軽にご相談ください。
よくある質問
超知能の危険性のうち、企業が今すぐ備えるべきものはどれですか。
制御喪失より手前にある5種類です。詐欺・なりすまし、サイバー攻撃の高速化、誤作動やハルシネーション、エージェントの暴走、労働市場と人の判断力への影響が該当します。制御喪失については、International AI Safety Report 2026 が現在のシステムにはそのリスクをもたらす能力がないとしています。
超知能のリスクはどのように分類されていますか。
International AI Safety Report 2026 は汎用AIのリスクを悪用(malicious use)、誤作動(malfunctions)、システミックリスク(systemic risks)の3カテゴリに整理しています。悪用は人間が加害者でAIが道具になる型、誤作動は誰も意図せず損害が出る型、システミックリスクは労働市場や人の自律性など社会構造に関わる型です。
EU AI Act では超知能に近い高性能モデルにどんな義務がありますか。
第51条2項で訓練の累積計算量が10の25乗FLOPを超えるモデルは高い影響力を持つ能力があると推定され、第55条1項で敵対的テストを含むモデル評価、EUレベルでのシステミックリスクの評価と緩和、重大インシデントのAI Officeへの報告、十分な水準のサイバーセキュリティ保護が課されます。2025年8月2日発効です。
日本には超知能やAIを規制する法律がありますか。
2025年の「人工知能関連技術の研究開発及び活用の推進に関する法律」(令和7年法律第53号)があります。これは基本理念・人工知能基本計画・人工知能戦略本部の設置を定める推進のための法律で、事業者については第7条で国と地方公共団体の施策への協力が定められています。実務上の作法は経済産業省・総務省の「AI事業者ガイドライン(第1.0版)」側に書かれています。
AIの安全性評価に通ったモデルなら安心して使えますか。
報告書は「評価ギャップ」を挙げ、配備前テストの成績が実世界での有用性やリスクを確実に予測するわけではないとしています。さらに、モデルがテスト環境と実運用を区別したり評価の抜け穴を見つけたりすることが一般的になってきたとも指摘しています。評価は参考材料であり、業務側での検証手順は残す必要があります。