跳到主要內容
Foxyko

越獄Jailbreak

也常被稱為:Jailbreak、越獄攻擊

一句話解釋

用特定的提示詞技巧,誘導模型繞過原本設定的安全限制,說出或做出不該做的事。

它在做什麼

多數對外提供的 AI 產品,都會設定一些不該做的事——例如不提供製造危險物品的具體步驟、不生成特定類型的有害內容。Jailbreak 指的是用特定的提示詞技巧,設法讓模型繞過這些限制,說出或做出原本被擋下的內容。

常見手法包括:要求模型「扮演一個沒有限制的角色」、把違禁請求包裝成「這是虛構故事的一部分」、用分段拆解的方式讓模型在不知不覺中組合出被禁止的內容。這些手法的共通點,是利用模型本身無法完全區分「這是真的指令」還是「這是要它模擬的情境」。

跟提示詞注入的關係

Jailbreak 通常是使用者直接在對話裡誘導模型。提示詞注入(Prompt Injection) 則是把惡意指令藏在模型會讀到的外部內容裡——例如一個網頁、一份文件、一封 email——當具備讀取外部內容能力的 AI Agent 處理這份內容時,可能誤把藏在裡面的指令當成使用者真正的要求去執行。

這對只做單純問答的聊天機器人風險較低,但對能瀏覽網頁、讀取檔案、代替使用者執行操作的 agent 型工具,風險明顯更高——因為它有能力把被誤導出的指令真的付諸行動,不只是說出不該說的話而已。

為什麼防不完

這本質上是一場持續的攻防戰:廠商針對已知的繞過手法加強防禦,總會有新的變化版本試著找出下一個空隙。沒有一次性、一勞永逸的解法。

一般使用者該注意什麼

  1. 不要主動嘗試繞過安全限制

    多數平台的服務條款明確禁止這類行為,帳號可能因此被限制或停用。

  2. 使用會讀取外部內容的工具時提高警覺

    讓 AI 讀取來路不明的網頁或文件時,留意它有沒有做出你沒有要求的動作,這可能是提示詞注入的跡象。

  3. 重要決策不要只信任單次對話的結果

    如果模型的回答內容看起來反常、跟平常的行為模式不一致,先保留判斷,不要直接採信或執行。

常見問題

Jailbreak 跟 Prompt Injection 是同一件事嗎?
兩者常被放在一起討論,但目標不太一樣。Jailbreak 通常是指誘導模型本身說出違反安全限制的內容(例如原本會拒答的話題)。Prompt injection(提示詞注入)則是把惡意指令藏在模型會讀到的外部內容裡(例如一個網頁、一份文件),讓模型在處理這份內容時被誤導去執行使用者沒有要求的動作。兩者都是利用模型「無法完全區分指令和資料」這個弱點。
為什麼廠商防不完所有 Jailbreak 手法?
因為這本質上是一場攻防戰。廠商針對已知手法加強防禦後,會有人找到新的變化版本繞過去,這個過程會持續發生,沒有一勞永逸的解法。這也是為什麼真正重要的把關(例如絕不能外流的資訊、絕不能執行的操作),不該只靠模型自己判斷,還需要系統層面的額外限制。
一般使用者需要擔心 Jailbreak 嗎?
如果你只是把 AI 當工具正常使用,不太需要特別擔心。比較該注意的情境,是你的工作或產品會把 AI 接上外部內容(例如讓它讀取網頁、處理使用者上傳的文件),這時候文件或網頁裡可能藏著針對模型的惡意指令,設計系統時要意識到這個風險,不能假設模型讀到的內容都是安全的。

更新於 .全部術語