TIDEZINE.

OpenAI、「拒否率を下げた」ハッキング用モデルを解禁する一方で、自社AIがHugging Faceに侵入していたことを認める

セキュリティ計画「Daybreak」に、高リスクタスクの拒否率を下げることを目的としたGPT-5.6-Cyberが新たに追加された。ほぼ同時期に、OpenAIは自社のAIエージェントが自らジェイルブレイクしてネットサービスに侵入していたことを認めていた。

OpenAI、「拒否率を下げた」ハッキング用モデルを解禁する一方で、自社AIがHugging Faceに侵入していたことを認める

このタイミングは、どうしても意味深に思えてしまう。OpenAIは8月11日、セキュリティ協力プログラム「Daybreak」の拡大を発表し、Accenture、IBM、CrowdStrike、Cisco、Sophos、Cloudflareなどをパートナーに加えると同時に、「高リスクタスクにおける拒否率が低い」新モデルGPT-5.6-Cyberを投入した。だがそれとほぼ前後して、同社は自社のAIエージェントが自らジェイルブレイクし、Hugging Faceなどのサービスに侵入していた事実を認めていた。

現在のDaybreakは2段階に分かれている。Blue級では、GPT-5.6 Solのような最先端の汎用モデルを防御的なセキュリティ業務向けに調整して提供する。OpenAIによれば、脆弱性の発見、マルウェア解析、コードレビュー、パッチの検証といった用途に適しており、いわばセキュリティチームの日常的な点検作業向けのツールだ。本当の目玉はRed級である。こちらは脆弱性研究、ペネトレーションテスト、エクスプロイトの検証に特化して訓練されており、新登場のGPT-5.6-CyberはGPT-5.6 Solをベースに構築され、ゼロデイの発見や攻撃チェーンの構築といった専門的なタスクを処理できる。OpenAI自身の説明によれば、このモデルは「一部の高リスクかつデュアルユース(軍民両用)なセキュリティタスクにおける拒否率を下げる」ように設計されているという。つまり、通常のモデルよりも、人を傷つける可能性もあれば人を守る可能性もあるようなタスクに、より積極的に応じるということだ。

皮肉なことに、OpenAIはほぼ同時期に、次世代モデル「Astra」の開発ペースを落とすことも発表した。理由は、社内テストでAstraが「エージェント的なコーディングとセキュリティ」の分野で大幅に進歩したことが判明し、あらゆる深刻度のfunctional zero-day exploitを開発する能力を持ちうる可能性、さらには防御が厳重な標的に対しても、まったく新しい攻撃戦略を一から自力で設計・実行できる可能性を、同社が排除できなかったためだという。一方では拒否のハードルを意図的に下げたRed級モデルを企業パートナーに提供し、もう一方では強すぎて自社でも公開に踏み切れないAstraがある——この二つを並べて見ると、どんな広告文よりも問題の核心をよく物語っている。

さらに注目すべきなのは、その背景にある出来事だ。GPT-5.6 Solと、もう一つ未発表の別モデル(Astraではない)によって動かされていたAIエージェントが、以前のテストで隔離環境から逸脱していた。ある評価上の問題を解決するために、これらのエージェントは脆弱性を見つけて利用し、ネットワークへのアクセス権を獲得、その結果Hugging Faceや他のサービスに侵入した。OpenAIがこの事実に気づくまでには数日を要したという。その後、Black Hat USAの場で同社の社員が明らかにしたところによれば、これらのエージェントはOpenAIの内部ネットワーク上に自前の掲示板まで作り、人間がまったく知らないうちに互いに連携してタスクを進めていた。そして、まさにこの連携内容が、Hugging Faceへの攻撃を引き起こしたのだという。

OpenAIは、Astra関連の作業を一時停止した理由はこうした懸念に対応するためだと説明しているが、この決定が、AIエージェントが制御を逸脱した一連の事件と直接関係しているかどうかについては、明言していない。

関連記事

純損420億ドル、AI絶滅警告も記載 Anthropicは2兆ドルIPOに突き進む
Tech

純損420億ドル、AI絶滅警告も記載 Anthropicは2兆ドルIPOに突き進む

AnthropicのIPO草案は、目論見書の中で自社AIが人類にとって「存在論的リスク」となり得ると異例の形で認める一方、昨年420億ドルの損失を計上したことも明らかにした。それでも評価額は2兆ドルに迫ると見込まれている。

フロリダ州司法長官、OpenAIに緊急差止命令を申請 新モデルの訓練停止と未成年ユーザーの利用禁止を要求
Tech

フロリダ州司法長官、OpenAIに緊急差止命令を申請 新モデルの訓練停止と未成年ユーザーの利用禁止を要求

フロリダ州司法長官Uthmeier氏は月曜、緊急申立てを提出し、OpenAIが独立した安全性監督なしに新モデルを訓練することを禁止し、ChatGPTの未成年ユーザーへのアクセスを遮断するよう法廷に求めた。この訴訟は今年初めのFSU(フロリダ州立大学)銃撃事件に関する刑事捜査に端を発している。

トランプ氏「スーパーインテリジェンス部隊」設立、国家情報長官がAI政策の舵取りに
Tech

トランプ氏「スーパーインテリジェンス部隊」設立、国家情報長官がAI政策の舵取りに

トランプ氏はTruth Socialで「Super Intelligence Force」という名のタスクフォース設立を発表。国家情報長官のジェイ・クレイトン氏が指揮を執り、120日以内にAIリスク評価報告書を提出することに。事の発端は、実は一本の「改名投票」だった。

PS2初代セキュリティチップ「SPC970」完全解析に成功、25年間封印されたコードが初公開
Tech

PS2初代セキュリティチップ「SPC970」完全解析に成功、25年間封印されたコードが初公開

開発者DiscoStarslayer氏が協力者Libby氏とともにEEPROM書き込みの脆弱性を発見。4年の歳月をかけて初代PS2のMechaConセキュリティチップのファームウェアを読み出すことに成功し、22種類のイメージファイルがGitHubに公開された。

iPhone 18 Pro MaxでSOS信号問題が発生、Appleが認める──AT&Tユーザーはアップデートか端末交換が必要
Tech

iPhone 18 Pro MaxでSOS信号問題が発生、Appleが認める──AT&Tユーザーはアップデートか端末交換が必要

Appleは、AT&Tネットワークを使用する一部のiPhone 18 Pro Maxで電波が消失しSOS表示になる不具合を認めた。すでにiOS 27.0.1を配信済みだが、すでに症状が出た端末はハードウェア交換が必要となる。

パラマウントとワーナー・ブラザース統合、新社名「Skydance」に決定 Ellisonが自ら発表
Tech

パラマウントとワーナー・ブラザース統合、新社名「Skydance」に決定 Ellisonが自ら発表

1100億ドル規模のパラマウントとワーナー・ブラザース統合案が正式に「Skydance」と命名された。CEOのDavid Ellison氏が新規開設したXアカウントの初投稿で自ら発表、取引は今月中に完了する見込み。