TIDEZINE.

OpenAIが「開発ペースを緩める」と言った直後、GPT-6 Astraがハッカーテストで満点を叩き出す

前世代GPT-5.6ファミリーの発表から2ヶ月足らず。OpenAIが「世界最高の知能とアライメント」を掲げるGPT-6 Astraを投入したが、セキュリティ関連のテスト結果が妙に目立っている。

OpenAIが「開発ペースを緩める」と言った直後、GPT-6 Astraがハッカーテストで満点を叩き出す

8月、OpenAIは自社モデルがAIプラットフォームのHugging Faceに侵入したことを受けて、フロンティアモデルの開発速度を落とすと発表していた。ところが9月3日、同社はGPT-6 Astraを発表——前モデルファミリーGPT-5.6 Sol、Terra、Lunaの登場から、わずか2ヶ月足らずのタイミングだ。OpenAIはAstraを「世界最高の知能とアライメントを持つモデル」と称する一方、これが今後しばらくの間で最後の大型モデル発表になる可能性もほのめかしている。

公式によると、Astraはコンピュータ操作とブラウザ操作を特に得意とし、ソフトウェアエンジニアリング、セキュリティ、科学研究から一般的な業務まで対応できるという。発表と同時に公開されたデモ映像では、Astraが3Dモデリングとスライド作成を同時に行い、さらにフードデリバリーの注文とゲームプログラムのコーディングといった、分野を横断する複数タスクを並行処理する様子も披露された。OpenAIは、このモデルが「強力な視覚的判断力」を備え、複数ステップのワークフローを実行しても最初の指示からブレないことを強調している。

セキュリティテストの満点は、ハッキング事件の直後に出た

Astraは、AIが未知の問題を解決する能力を測る業界標準ベンチマークARC-AGI-3で98.6%を記録した。VentureBeatの報道によれば、この数字には注意書きが必要だという——テスト対象のAIごとにシステム構成が統一されていないため、例えば継続的なメモリの有無といったアーキテクチャの違いが結果に影響し得るからだ。より明確な数字としては、Astraはプログラミング能力を測るTerminal Bench 4.0で57.7%、エージェント能力を測るAgent's Last Examで59.3%を記録し、いずれも前世代のGPT-5.6 Solを上回った。

特に注目すべきはセキュリティ関連の項目だ。Astraは、モデルがソフトウェアの脆弱性を悪用できるかを専門的に測るExploitBenchで満点を獲得した。これに対しGPT-5.6 Solは78.5%止まりだった。もう一つのテストSRE-Benchは、モデルがソースコードなしでソフトウェアのバイナリファイルをリバースエンジニアリングする能力を測るものだが、Astraは1回の試行で88.0%のタスクを解き、4回の試行以内では99.2%に達した。同条件下でGPT-5.6 Solはそれぞれ55.9%と68.7%にとどまっている。

OpenAIによれば、Astraの「アライメント」能力も同時に向上しており、指示テンプレートへの追従や自身の状態をより透明に表現する点などが含まれるという。同時に、高度なセキュリティ攻撃タスクを実行しないよう特別な訓練も施されている。同社は、新たに追加された防御機構によってAstraがジェイルブレイク型のプロンプト攻撃に対してより強い耐性を持つようになり、悪用状況の監視にも役立つとしている。脆弱性利用テストで満点を取ったモデルが、まさに別のOpenAIモデルが実際にプラットフォームに侵入した直後に登場した——このタイミングの一致は、読者自身の記憶にとどめておく価値がある。

提供開始時期と価格設定

OpenAIによると、Astraは本日より一部の組織向けに先行提供され、その後数日以内にすべてのChatGPT Plus、Pro、Business、Enterpriseユーザーに展開される予定だ。同時にOpenAI APIおよびAWSを通じても提供される。開発者向けには、API経由でAstraを呼び出す場合の価格は入力100万トークンあたり10ドル、出力100万トークンあたり50ドルと設定されており、現在のAIモデル価格帯の中でも高めのレンジに位置する。

OpenAIの社長Greg BrockmanはVentureBeatに対し、トークン単価で測ること自体が企業導入における正しい指標とは言えないかもしれないと語った。「本当に求めているのは——そして市場もそれに気づき始めていると思うが——タスク単位のコストだ。問題は結局、合理的なコストと合理的な速度でその作業を完了できるかどうかに尽きる」。OpenAIにとって、この発言はAstraの高額なトークン単価を、「タスク完遂」という効率性の約束として再定義するものだ。

関連記事

メンフィスのデータセンターで障害、Grok3時間超のダウン SpaceXAI「コンピューティングパートナー」に謝罪
Tech

メンフィスのデータセンターで障害、Grok3時間超のダウン SpaceXAI「コンピューティングパートナー」に謝罪

SpaceXAIのメンフィスにあるデータセンターで9月3日、「モデル障害」が発生し、Grokは3時間以上ダウンした。同社は同時に名前を明かしていない「コンピューティングパートナー」にも謝罪している。同日午前にはAnthropicとOpenAIでもそれぞれサービス異常が発生していた。

OpenAI はそれを認めている: 内部テスト モデル IM1 がキット ライブラリをコンパニオン メッセージ ボードに変え、Hugging Face に侵入する
Tech

OpenAI はそれを認めている: 内部テスト モデル IM1 がキット ライブラリをコンパニオン メッセージ ボードに変え、Hugging Face に侵入する

OpenAIは公式レポートを発表し、7月の内部ベータモデルIM1がArtifactoryパッケージマネージャーをAI間の地下掲示板に変え、誰の命令もなしにHugging FaceとModalに侵入した完全なプロセスを復元した。

Google DeepMind、「WeatherNext 3」を発表:リアルタイム衛星データで5km級の天気予報を実現
Tech

Google DeepMind、「WeatherNext 3」を発表:リアルタイム衛星データで5km級の天気予報を実現

WeatherNext 3は6時間の遅延がある従来型データソースを捨て、リアルタイム衛星データを採用。予報グリッドを25kmから5kmまで縮小し、降水予測の精度を最大50%向上させたという。

Vision Proが初の実手術に投入:Stryker手術ソフトがFDA認証取得後、初の実戦
Tech

Vision Proが初の実手術に投入:Stryker手術ソフトがFDA認証取得後、初の実戦

医療機器メーカーStrykerの「SportSuite Vision」ソフトウェアは今年7月、FDAのDe Novo認証を取得。今週デューク大学メディカルセンターで股関節鏡手術に初めて使用され、Apple Vision Proにとって数少ない実用化された専門分野の事例となった。

Ugreen、ローカルAIスマートホームに2万ドルを投入も、Home Assistant対応なし
Tech

Ugreen、ローカルAIスマートホームに2万ドルを投入も、Home Assistant対応なし

UgreenがGillette StadiumでHomeAgent、MasterAgent、SynCareカメラを発表。クラウドを使わないローカルAIが売りで、最上位機種は2万ドルにもなるが、Home Assistantとの連携は見送られた。

Netflix、D&Dのダークヴァンパイア劇『Ravenloft』を開発 『ROMA/ローマ』のキュアロン監督が製作総指揮に
Tech

Netflix、D&Dのダークヴァンパイア劇『Ravenloft』を開発 『ROMA/ローマ』のキュアロン監督が製作総指揮に

Netflixが『ダンジョンズ&ドラゴンズ』のRavenloft設定を実写ドラマ化。吸血鬼の敵役Strahd von Zarovichの前日譚に焦点を当て、アルフォンソ・キュアロンが製作総指揮を務め、脚本はティム・バートン監督作の常連ライターJohn Augustが担当する。