ジェイルブレイクとは、生成AIの安全制限や拒否ルールを回避する試みです。本来は応答しない内容を引き出そうとします。
ChatGPTなどの生成AIには安全対策があります。危険な情報や不適切な内容を無制限に出力しないためです。
ただし、ジェイルブレイクという言葉は、安全性評価でも使われます。本記事では意味や仕組みを初心者向けに解説します。さらに、プロンプトインジェクションとの違いや安全な文脈での使われ方も紹介します。
ジェイルブレイクとは?
ジェイルブレイクは英語で「jailbreak」と書きます。もともとは「脱獄」を意味する言葉です。
生成AIでは、安全制限を「壁」に見立てます。その壁を越え、本来は禁止されている回答を引き出そうとする行為を指します。
OpenAIも、ジェイルブレイクを安全性評価の対象にしています。モデルの拒否を回避し、有害な支援を引き出そうとする敵対的なプロンプトを検証しています。
AIでの意味
通常の生成AIは、入力された内容を何でも実行するわけではありません。安全ルールや指示に従って動作します。
たとえば、サービス提供者の安全ポリシーや、開発者の指示を考慮して回答します。そのため、危険な依頼には回答を拒否する場合があります。また、安全な内容へ置き換えることもあります。
ジェイルブレイクは、こうした安全制限を意図的に回避することを目的とします。

スマートフォン用語との違い
「ジェイルブレイク」は、端末の制限を解除する意味でも使われてきました。スマートフォンなどで用いられる表現です。
生成AIの場合、対象は端末のOSではありません。AIモデルやサービスに設定された安全上の制約が対象です。
共通点は「設定された制限を外す」というイメージです。ただし、対象となる技術やリスクは異なります。
ジェイルブレイクの仕組み
ジェイルブレイクを理解するには、AIが複数の指示を受ける点を押さえましょう。生成AIは、それらを考慮して回答します。
AIには複数の指示と安全ルールがある
生成AIサービスでは、ユーザーの質問だけが動作に影響するわけではありません。サービス側の安全ルールや開発者の指示も影響します。
OpenAIは「Instruction Hierarchy」の研究と改善を進めています。これは指示の優先関係を明確にする考え方です。安全ルールとユーザー指示が競合した場合は、高い優先度の指示を守ります。
敵対的な入力が安全ルールとの競合を狙う
一方、生成AIは自然言語を使って多くの指示を処理します。
攻撃者が複雑な指示や通常と異なる文脈を入力する場合があります。安全ルールより攻撃者の指示を優先させようとするためです。
つまり、これがジェイルブレイクの基本的な考え方です。
ただし、「特定の文章を入力すれば必ず突破できる」という単純な仕組みではありません。モデルや安全対策は継続的に更新されており、AI提供企業も訓練、監視、分類器、レッドチーミングなどを組み合わせて対策しています。
ジェイルブレイクとプロンプトインジェクションの違い
ジェイルブレイクとプロンプトインジェクションは関連が深く、資料によって分類方法が多少異なります。
NISTは、直接プロンプトインジェクションの一部をジェイルブレイクと整理しています。これはモデル悪用のためにセーフガードを回避する行為です。一方、OpenAIは外部コンテンツ内の悪意ある指示を、主にプロンプトインジェクションとして説明しています。
そのため、初心者向けには次のように整理すると理解しやすいでしょう。
| 項目 | ジェイルブレイク | プロンプトインジェクション |
|---|---|---|
| 主な目的 | AIの安全制限を回避する | AIを本来とは異なる指示へ誘導する |
| 主な標的 | モデルの安全ガード | AIが処理する指示や外部コンテンツ |
| 典型的な状況 | ユーザーが制限回避を狙う | Webページやメールなどに悪意ある指示が含まれる |
| 関係 | プロンプトインジェクションの一種として整理される場合がある | より広い攻撃概念として扱われることがある |
つまり、ジェイルブレイクは特に「安全制限の突破」に焦点を当てた言葉と覚えておくと分かりやすいでしょう。

安全性評価での使い方
なお、「ジェイルブレイク」は悪意ある攻撃だけを意味する言葉ではありません。
また、AI企業や研究者が、モデルの安全性を検証するために使うこともあります。
| 使用場面 | 例 |
|---|---|
| AI安全性評価 | 「このモデルのジェイルブレイク耐性を評価する」 |
| レッドチーミング | 「想定外の入力に対して安全制限が維持されるか検証する」 |
| セキュリティ教育 | 「ジェイルブレイクのリスクを理解してAIを安全に運用する」 |
| モデル比較 | 「安全対策を回避されにくいかという観点でモデルを評価する」 |
ただし、正当なテストでは許可された範囲で検証することが重要です。対象システムの所有者や提供者の条件を守りましょう。
そのため、知識として理解することと、無断で実行することは分けて考えます。他者のAIサービスを無断で突破してはいけません。
ジェイルブレイクの主なリスク
成功した場合、本来は安全上の理由で制限される回答が生成される可能性があります。
さらに、危険・有害な情報が出力されるリスクがあります。安全方針から外れた回答や、対策への信頼性低下にもつながります。
AIが外部ツールやデータへアクセスする場合は、権限管理も重要です。さらに、実行前の確認なども必要になります。
ただし、外部コンテンツ経由の攻撃は別の分類になる場合があります。プロンプトインジェクションと整理するほうが適切なケースもあります。
ジェイルブレイクへの主な対策
ジェイルブレイク対策では、複数の防御を組み合わせます。1つの仕組みだけに依存してはいけません。
AI提供企業は、モデルの安全訓練だけに頼りません。指示階層、入出力監視、安全分類器、レッドチーミングなども利用します。OpenAIも安全評価で耐性を検証し、複数の対策を組み合わせています。
開発・運用側では、AIへ必要以上の権限を与えないことが重要です。また、重要な操作には人の確認を挟みます。外部情報を無条件に命令として扱わない設計も有効です。
なお、対策は継続的に研究されています。一度対策すれば完全に安全とは考えず、モデルや防御を更新しながら検証しましょう。

ジェイルブレイクに関するFAQ
ジェイルブレイクとプロンプトインジェクションは同じですか?
完全に同じ意味ではありません。
分類方法には幅があります。ジェイルブレイクは主に安全制限の回避に焦点を当てます。一方、プロンプトインジェクションは、AIの本来の動作を変えようとする広い問題です。
違法になる場合はありますか?
「ジェイルブレイク」という言葉自体や、安全性を研究することが直ちに違法という意味ではありません。
ただし、実際の行為が許されるかは状況によって異なります。利用規約、検証の許可、実施内容、利用する情報などを確認してください。
完全に防ぐことはできますか?
したがって、現時点でどのような攻撃にも完全に耐えられると考えるのは適切ではありません。
AI提供企業は、安全訓練や監視を組み合わせています。さらに、指示階層やレッドチーミングなどを使い、耐性を改善しています。
ChatGPTにも関係しますか?
また、ChatGPTを提供するOpenAIも、モデルの安全性評価でジェイルブレイク耐性を検証しています。
安全対策やモデルは更新されます。そのため、固定的な突破方法として理解してはいけません。AIセキュリティ上のリスク概念として捉えましょう。
まとめ|AIの安全性を考える重要な用語
ジェイルブレイクとは、生成AIの安全制限や拒否ルールを回避する試みです。本来は提供しない回答を引き出そうとします。
さらに、プロンプトインジェクションと関連する概念でもあります。ただし、特に安全ガードの突破に重点がある点が特徴です。
一方、AI開発やセキュリティの現場では、ジェイルブレイクへの耐性を調べることが安全性向上につながります。重要なのは、攻撃方法を無断で試すことではなく、仕組みとリスクを理解し、許可された範囲で検証することです。
生成AIを安全に使うためにも、重要な用語として覚えておきましょう。ジェイルブレイクは、AIの安全性を考えるためのセキュリティ概念です。
