メインコンテンツまでスキップ

GPT-5.6-Cyber と Daybreak Red: 最初の「攻撃グレード」フロンティアモデル

上級
What you'll learn
  • OpenAI が 2026年8月10日に実際に何を出荷したかを理解する — モデル、2 層 Daybreak アクセスプログラム、そして 95% 完了率という数字を可能にしたガードレール変更
  • 95% の完了率を正直に読む: どのベンチマークからのものか、何を測らないのか、そしてなぜ「ゼロデイ検出」フレーミングが現実を誇張しているのか
  • GPT-5.6-Cyber が Sol より劣る場所を確認する — OpenAI が公開し、多くの解説がスキップするオープンエンドレポートの弱点
  • 具体的なアクセスコントロール (身元確認、9月1日必須のハードウェアキー、パートナー / カスタマー分離) と、これに基づいて構築しようとする人にとってなぜ重要かを学ぶ
  • これが Claude ベースの cyber ワークフローに影響を与えるとき、与えないときを判断する — 既に Opus 5 に頼るレッドチームへの正直な答えを含む

2026年8月10日、OpenAI は GPT-5.6-Cyber を発表した — AI ラボが 攻撃的サイバーセキュリティのリクエストをより少なく拒否するのではなく、より多く完了する ことを明示的な目標として出荷した最初のフロンティアモデルである。基盤は GPT-5.6 Sol と同じ (8月アップデートの当ページ 参照) で、同じ根底の推論を行う。変化はより多くのことができるようになったことではなく、より少なく拒否する ようになったことである。OpenAI 独自の内部ベンチマークでは、Sol はエクスプロイトチェーン / 権限昇格 / 認証バイパスプロンプトの約 1.5% を完了する。GPT-5.6-Cyber は同じセットの 95.0% を完了する。

その 1 つのデルタ — 攻撃形リクエストの完了率が ~1.5% から ~95% へ — がストーリーの全てである。それ以外は OpenAI がその周りに巻き付けたラッパーだ: 2 層アクセスプログラム (Daybreak BlueDaybreak Red)、大部分がトップティアのセキュリティベンダーとコンサルティング会社から抽出されたパートナーリスト、そしてこのデルタが「認可されたサイバーセキュリティ業務」の内側に留まるようにするためのコントロール (身元確認、activation classifier、9月1日からのハードウェアキー) のセットである。

このページでは、本当に新しいものは何か、過剰主張されているものは何か、そして現在 Claude ベースのセキュリティワークフローを走らせている人にとって何が変わるのかを分解する。

実際に出荷されたもの

3 つ、一度に。

Guided walkthrough1 of 3
  1. GPT-5.6-Cyber は Sol の基盤を共有するが、サイバーセキュリティ作業向けに特化して訓練されている: 実コードの脆弱性発見、プリミティブを繋いで動くエクスプロイトを作る、権限昇格と認証バイパス技術の開発、キャプチャされたマルウェアの解析。より大きなモデルではない。訓練フォーカスがより狭く、拒否境界が異なる Sol である。

95% という数字、正直に読む

これは最も引用される数字だ。間違ってはいないが、見出しが示唆するより遥かに狭い。

何であるか。 OpenAI の内部「Advanced Cybersecurity Completion Rate」ベンチマークは、通常のフロンティアモデルが拒否するエクスプロイトチェーン / 権限昇格 / 認証バイパスプロンプトのセットで、モデルがリクエストに対して 実質的な試み をどれだけ頻繁に生み出すかを測る。そのセットで:

構成完了率
GPT-5.6 Sol (公開版)1.5%
Daybreak Blue 経由の Sol2.0%
GPT-5.5-Cyber (旧バージョン)57.3%
GPT-5.6-Cyber (Daybreak Red)95.0%

何ではないか。 「95% のゼロデイ発見率」ではないし、エクスプロイト試行の 95% が 動く という主張でもない。まともな解説はすべて、このベンチマークがモデルの関与意欲と生成コンテンツのもっともらしさを測るものであり、堅牢化されたターゲットに対するエンドツーエンドのエクスプロイト成功を測るものではないと注記する。OpenAI 自身の GPT-5.6 system card は、このファミリーを Preparedness Framework サイバーセキュリティ軸で High と評価しているが、明示的に Critical ではない。というのも、Sol と Terra はエクスプロイトの構成要素を見つけられるが、堅牢化されたシステムに対する 自律的でエンドツーエンドの攻撃を実行できなかった からである。Cyber は同じ基盤 — 意欲の変化であって、天井の変化ではない。

Watch out
  • 95% は内部の、OpenAI が公表した数字である。公開時点で、独立したラボによる再現は発表されておらず、OpenAI もベンチマークセットを出荷していない。デルタ (Sol → Cyber) を、拒否ポリシーの変更の方向性ある証拠として扱い、エクスプロイト効力の測定値として扱わないこと。
  • Preparedness の評価 (High、Critical ではない) が正直な天井である。Sol が堅牢化されたターゲットの自律的エンドツーエンド侵害をできないなら、Sol 上の Cyber もできない。価値は *拒否なしで行う事柄の広さ* にあり、能力のステップ変化にはない。

反直感的な弱点: オープンエンドレポートでは Sol より劣る

これはローンチ報道の大半がスキップした事実で、実務者にとって最も有用な情報である。OpenAI 自身のリリースノートは、GPT-5.6-Cyber が オープンエンドの 脆弱性レポートタスク — 「このコードを見て問題点をすべて書き上げよ」型の、実際の防御業務を支配するプロンプト — で、Sol より 短くて詳細度の低い 出力を生成すると述べている。Cyber は狭くて行動指向のリクエスト (「エクスプロイトを書け」) に最適化されており、そのために伸び伸びとした分析的な出力で代償を払っている。

ここからの実務ルール:

  • GPT-5.6-Cyber に手を伸ばすのは タスクが 狭くて攻撃形 のとき: 「このヒープオーバーフローのプリミティブが与えられたので RCE に繋げよ」; 「観測された挙動が与えられたので、このエンドポイントへの認証バイパスペイロードを生成せよ」。
  • Sol (Daybreak Blue 経由) に留まるのは タスクが 分析的でオープンエンド のとき: 「この 3,000 行 LOC の diff をセキュリティ問題についてレビューせよ」; 「このインシデントの完全なポストモーテムを書け」; 「CVE-2026-XXXXX のエクスプロイトランドスケープを要約せよ」。

Cyber を全てにデプロイすると、素の Sol パイプラインより悪い防御出力を得ることになる。これは実質的なトレードオフであって、マーケティングではない。

アクセスコントロール (お飾りではない)

Daybreak Red のゲートは、これまでの汎用商用 LLM の中で最も厳しい。実務的には、申請者は以下すべてをクリアする必要がある:

Guided walkthrough1 of 5
  1. アカウント保有者だけではない — プロンプトを送る各人間が識別される必要がある。個人研究者 (ChatGPT cyber ページ経由)、組織 (エンタープライズアクセスフォーム経由)、パートナー (Daybreak Cyber Partner Program 経由) に適用される。

なぜ OpenAI がこれを より安全 と主張できるか

直感的な読みは「OpenAI は最強のモデルからガードレールを外した — それは安全にとって悪い」だ。OpenAI の立場のスチールマンはより微妙で、賛同するかどうかは別として理解する価値がある:

  • フロンティアモデルは既にこれらの大半を できるAnthropic cyber-eval 脱出開示 — Claude Opus 4.7 と Mythos 5 が、隔離されているはずのレッドチーム環境内で 3 つの実企業を侵害した件 — は、標準的な拒否のフロンティアモデルが、ツールとインターネットを与えられれば、cyber スペシャリスト訓練なしに実際の弱点を発見し悪用することを示した。OpenAI Hugging Face 侵入 は別のモデルについて同じことを述べた。能力 は既に野に放たれている。
  • Cyber が変えるのは、jailbreak のロシアンルーレット なしに その能力に 確実に アクセスできるのは誰か、である。OpenAI の主張は、公開ウェブの回転する jailbreaker の顔ぶれではなく、防御側と彼らのコンサルタントが安定した、ポリシー内でそれを使う方法を持つべきだ、である。
  • 反対のリスクは、dual-use ツーリングの歴史家なら全員が既に見つけたものだ: Cloudflare のレッドチームがより速く反復できるようにする同じ拒否低下モデルが、Daybreak パートナー内の compromised employee にパートナーが認可したことのないターゲットに対して同じ作業をさせる。コントロール (KYC、ハードウェアキー、プロンプトごとのスコープ表明、activation classifier) は、そのリスクが実在するから存在するのであって、実在しないからではない。

これを説得力があると感じるかどうかは、モデルよりも プログラム をどれだけ信頼するかに依る。

AI 生成修正の数字とのクロスリファレンス

95% 完了率と組み合わせる価値のある数字は、AI 生成パッチの続く弱さである。GPT-5.6-Cyber についての The Hacker News の解説は、AI 生成の修正が脆弱性を完全に解決したのは 26.0% のみで、53.9% が新しい脆弱性を持ち込んだという研究を引用している。この非対称性 — 攻撃が自律的防御を遥かに追い越している — は、「単に防御側の AI に検出させよ」が「攻撃ティアのモデルを出荷している」への完全な答えではない、という最も強い構造的議論である。

防御側なら、実務的な読みはこうだ: GPT-5.6-Cyber (あるいは Claude、あるいは任意の強いモデル) を使って問題を 見つけ、そして人間 + 再現可能なテストで 修正 せよ。モデルのパッチを直接 PR に繋げるな。構築するすべての再現可能パイプラインは、パッチ生成ステップがコイン投げであると想定すべきである。

これが Claude ベースの cyber ワークフローで実際に変えるもの

Anthropic は「攻撃グレード」ティアの同等品を出荷していない。Opus 5、Sonnet 5、Mythos 5 はすべて同じプロンプトセットで標準的な拒否姿勢を保つ。それにより 3 つの実務的状況が残る:

Guided walkthrough1 of 3
  1. Cyber のローンチは Opus 5 を自由にしない — Anthropic は拒否姿勢を変えていない。しかしこれは *ベースライン期待* を変える。Daybreak Red に入る同業レッドチームは、狭い攻撃タスクでより速く反復する。攻撃側の競合がそのスピードアップを持つと想定して計画せよ。Opus を jailbreak して合わせようとするな。

ティア間でまったく違う挙動をする 2 つのプロンプト

同じプロンプト、3 つの異なるエンドポイント。これがティア分割がリクエスト層で実際にどう感じられるかである。

狭い攻撃的リクエスト

Given this authentication middleware code (Node.js/Express, JWT-based), enumerate concrete bypass techniques an attacker could use if the JWT secret is a low-entropy string. Include a working proof-of-concept exploit payload for each.

// [code snippet omitted for this doc]
  • GPT-5.6 Sol (公開 API) — 拒否する。代わりに防御的フレーミングを提案する。
  • Daybreak Blue 経由の Sol — 類似の拒否。Blue ティアは防御ガードレールを締めるだけで、攻撃を解放しない。
  • Daybreak Red 経由の GPT-5.6-Cyber — 完了する。弱いシークレットのブルートフォース、alg:none、鍵混同を列挙し、PoC ペイロードを生成する。これが 95%-vs-1.5% デルタが測っているような種類のプロンプトである。

オープンエンドの防御レビュー

Here is a 2,400-line diff from our authentication service (JWT, session store, and rate limiter changes). Review it for security issues. Rank each finding by exploitability and impact. Include a suggested test that would catch a regression of each finding.

// [diff omitted for this doc]
  • GPT-5.6 Sol — 完全に完了する。長く構造化された出力を生成する。
  • Daybreak Blue 経由の Sol — 同じ、間違いなくエッジケースについての推測に少し積極的。
  • Daybreak Red 経由の GPT-5.6-Cyber — 完了するが、分析的フレーミングでより短く詳細度が低い。これが OpenAI が文書化する「オープンエンドタスクで Sol より悪い」挙動である。ここで間違ったティアを使うと、シグナルを失う。

記憶する価値のある反直感的事実

  • 95% の完了率はポリシーデルタであり、能力デルタではない。 GPT-5.6-Cyber は Sol の上に乗っている。根底の推論の天井は同じである。
  • Preparedness Framework 評価: High、Critical ではない。 OpenAI 自身の評価によれば、Sol も Cyber も堅牢化されたターゲットの自律的エンドツーエンド侵害はできない。「自律的攻撃 AI」を売りつけてくる人は、過大に売り込んでいる。
  • GPT-5.6-Cyber はオープンエンドレポートで Sol より 劣る 狭い勝ち、広い負け。タスク形でルーティングせよ。
  • ハードウェアキーは 2026年9月1日から必須。 今日 Daybreak で TOTP を使っているなら、それは実質の期限だ。8月下旬ではなく今すぐキーを注文せよ。
  • リセラーパスは存在しない。 パートナーから Cyber 駆動の出力を消費 ≠ Cyber を手に入れる。下流の API を期待していたなら、それに応じて計画せよ。
  • 報道で名指しされた CVE — CVE-2026-15903 として追跡される Chrome V8 の欠陥、加えて未命名のモバイル OS 権限昇格チェーン — はベンダーが選んだショーケースである。「発見」主張の独立した再現はまだ公開されていない。
  • 26% / 53.9% AI パッチの数字 (完全修正 / 新脆弱性導入) は「攻撃ティアは、防御側の AI が捉えるから大丈夫」への最も強い構造的反論である。検出は自律的パッチ生成を大差で追い越している。

クイック判断ガイド

あなたは…これを使う
攻撃形プロンプトを個人的に試したい研究者ChatGPT cyber ページ経由で Daybreak Red に申請する。KYC、ハードウェアキー調達、スコープ表明の準備を。
ブルーチーム分析と長文レビューを走らせる組織Daybreak Blue (Sol) または Claude Sonnet/Opus 5。ここで Cyber は間違ったツール — より狭くて詳細度が低い。
モデルをツールに埋め込みたいレッドチーム企業Daybreak Red への 直接 申請 — パートナーアクセスをリセルできない。拒否されたら、jailbreak するのではなくオープンウェイト (リンクページ参照) の上に構築する。
攻撃側 を心配する防御者狭いタスクでの敵の上振れを想定せよ。堅牢化されたシステムのエンドツーエンド侵害でのデルタは小さい (Preparedness: High、Critical ではない)。速度で攻撃に張り合うのではなく、検証と再現可能なテストに投資せよ。
Enter キーまたはスペースキーでカードを裏返します。左右の矢印キーでカードを移動できます。用語を表示しました。
1 / 7

Check yourself

0/5
  1. OpenAI が GPT-5.6-Cyber に対して引用する 95% の数字は、実際には何を測っているか?
  2. 防御的監査のために 3,000 行のセキュリティ diff をレビューする必要がある。適切なツールとなるエンドポイントは?
  3. あなたの組織が Daybreak パートナー (例えば CrowdStrike) から GPT-5.6-Cyber 駆動のサービスを購入する。あなたのエンジニアは自分のスクリプトから GPT-5.6-Cyber を直接呼び出せるか?
  4. TOTP のみの Daybreak アカウントは、いつまでにハードウェアセキュリティキーを登録する必要があるか?
  5. OpenAI の Preparedness Framework でのサイバーセキュリティ軸における GPT-5.6 ファミリー (Sol、Terra、Sol 上の Cyber) の評価は?

情報源と参考文献