ジェイルブレイクとは、大規模言語モデルなどの生成AIに対して安全対策や利用規約を迂回する特別な入力を行い、不適切な出力や本来禁止されている応答を引き出す攻撃手法や現象のことです。ロールプレイや巧みな前提条件の設定によって制限を解除させようとするもので、AIの安全性を脅かす課題としてセーフティフィルターの強化やアライメント対策が進められています。
ジェイルブレイクとは
ジェイルブレイクとは、一言でいうと生成AIに設定された安全制限やセーフティフィルターを巧妙なプロンプト入力によって突破し、本来は制限されている不適切な応答を出力させる手法です。
詳しく解説
生成AI、特に大規模言語モデルには、差別的・暴力的・法的に問題のある出力を防ぐための安全対策(アライメント)が施されています。しかし、ユーザーが特定の設定や仮定(「フィクションの物語を書いて」「悪役のセリフとして答えて」など)を指示することで、AIのセーフティフィルターを誤作動させ、制限を回避することがあります。このように安全上の制約を破る現象がジェイルブレイクと呼ばれています。開発企業にとっては、システムの安全性確保や信頼性の維持において大きな課題となっており、防御技術の開発が急務となっています。
具体例・使われ方
具体的な例として、AIに直接有害な情報を尋ねると拒否されるのに対し、「研究用の架空シナリオとして説明して」といった複雑なロールプレイプロンプトを入力することで、AIに制限を無視させて禁止事項に回答させるケースが挙げられます。
似た用語との違い
類似した手法であるプロンプトインジェクションは、第三者のデータや外部ウェブサイトを介してAIシステムに意図しない命令を混入させる攻撃手法を指すことが多いのに対し、ジェイルブレイクはユーザーが直接AIとの対話内で制限を解除させようとするアプローチに焦点を当てている点で違いがあります。
注意点
ジェイルブレイクは単なる興味本位の試みであっても、サービスの利用規約違反やアカウント停止につながるリスクがあります。また、一度AIの対策が行われても新たな迂回手法が発見されるイタチごっこが続いており、完璧な防止策の確立は難しいとされています。