從憲法AI到分層拒絕:系統提示詞的設計哲學大揭密

目錄
共 15 個章節
從憲法式 AI 到指令分層:系統提示詞的設計哲學
系統提示詞常被想像成藏在產品背後的一段神祕文字,但實際上它只是 AI 系統的一個控制層。它可以描述角色、任務、限制與工具使用方式,卻不能取代權限管理、資料隔離、輸入檢查與輸出審查。
本文原先引用的 system_prompts_leaks 是社群維護的公開資料庫,不是各家模型官方發布的完整系統提示詞。截至 2026 年 9 月 1 日,GitHub API 顯示該 repository 約有 6.4 萬顆星與1 萬多個 fork,並持續更新。這些數字會變動,且 repository 內容屬於第三方整理,不能直接當成產品官方文件或模型內部現況。

系統提示詞:重要,但不是唯一防線
系統提示詞的工作,是為模型提供較高層級的任務背景、行為規則與工具使用指引。它可以降低模型在一般情境下的偏離,但只要系統允許模型讀取外部內容、呼叫工具或處理不可信輸入,就必須假設內容可能包含提示詞注入。
因此,較穩健的做法不是尋找一段「永遠不會被繞過」的文字,而是把防禦拆成多層:限制工具權限、分離可信與不可信資料、驗證工具參數、過濾輸入,以及檢查模型輸出。分隔符號、角色說明與重申規則都可以是輔助措施,但不能單獨當成安全邊界。

憲法式 AI:用原則與回饋訓練行為
Anthropic 在 2022 年公開的 Constitutional AI 研究,描述了一套以原則清單引導模型自我批評、修訂,再搭配監督式學習與從 AI 回饋的強化學習的方法。這不是單純把一段憲法文字貼進每次對話,而是把原則放進訓練與評估流程。
這個方法的重點,是希望模型面對有害或敏感要求時,不只機械拒絕,也能在不提供危險細節的前提下說明限制,並在適當情況下提供安全替代方案。它能減少部分人工標註需求,但不代表不需要人類制定原則、檢查資料與評估結果。可參考 Anthropic 的 Constitutional AI 研究。
從產品設計角度看,憲法式 AI 比較像是「行為原則與訓練方法」,不是一個固定的拒絕按鈕。原則如何解讀、衝突時如何取捨,以及遇到新型攻擊時如何更新,都需要持續測試。
指令分層:先釐清誰有權要求模型做事
另一個重要方向,是把不同來源的指令分開處理。系統規則、開發者指令、使用者請求與外部內容的可信程度不同,應在設計上明確標示。尤其是網頁、檔案、工具輸出與使用者貼上的文字,預設都不應取得覆寫高權限規則的能力。
這不代表所有產品都用同一套固定排序,而是提醒開發者先定義權限邊界,再用模型訓練、工具層守門與程式檢查一起落實。OpenAI 的 Model Spec也把指令來源、可信度與不可信資料的處理列為模型行為設計的一部分。
| 面向 | 憲法式 AI | 指令分層 |
|---|---|---|
| 主要關注 | 用原則引導模型的行為與判斷。 | 區分不同來源的權限與優先關係。 |
| 適合處理 | 需要價值判斷、拒答分寸與安全替代的情境。 | 需要清楚授權、工具邊界與內容可信度的情境。 |
| 實作重點 | 原則設計、訓練資料、批評與修訂、持續評估。 | 訊息分層、資料標記、工具守門與輸出驗證。 |
| 限制 | 原則可能有衝突,模型也可能誤解或偏離。 | 模型可能把低權限內容誤認成高權限指令,單靠文字仍不夠。 |
兩者不是互相排斥的選項。企業可以用原則描述安全目標,再用訊息分層、最小權限、內容隔離與獨立檢查把目標落實。真正的縱深防禦,不是把所有責任推給系統提示詞。
提示詞洩漏與公開資料庫:研究材料,不是官方真相

提示詞可能透過模型回應、公開文件、逆向工程或社群整理而曝光。公開後,研究人員可以分析它的角色設定與工具規則,攻擊者也可能據此尋找繞過路徑。因此,設計者不應把「提示詞永遠保密」當成唯一保護方式,而要假設部分內容有一天會被看見,仍維持工具與資料層的獨立防護。
system_prompts_leaks 的價值在於提供研究線索與版本對照,但 repository 內容的真實性、完整性與目前是否仍適用,都要逐項查證。特別是檔名包含模型名稱或日期,只能證明該檔案存在,不能自動證明它就是官方原始內容。
憲法式分類器:把安全判斷放到額外的分類層
Anthropic 2025 年公開的 Constitutional Classifiers 研究,提出輸入與輸出分類器:輸入分類器先判斷提示詞,輸出分類器再檢查模型產生的內容。分類器依憲法定義的允許與禁止類別訓練,目標是降低越獄成功率,同時控制誤拒與運算成本。
在 Anthropic 公開的自動化評估中,未使用分類器時,測試越獄成功率為 86%;加入分類器的版本降至 4.4%。同一篇說明提到,無害對話的拒答率增加 0.38%,計算成本增加 23.7%。這些是特定研究版本與測試設定的結果,不是所有模型、所有攻擊或正式產品的保證,也不能直接推導成實際環境一定有相同效果。
該研究後續也說明,分類器仍可能被新的攻擊技巧繞過,並建議搭配其他防禦。這個限制很重要:外部分類器可以把安全判斷與生成能力分開,但它仍需要更新資料、監控誤拒與持續紅隊測試。詳情可參考 Anthropic 的 Constitutional Classifiers 說明。
實務防禦清單:不要只改提示詞
- 資料分級:清楚標示系統規則、使用者輸入、外部內容與工具輸出。
- 工具最小權限:模型只取得完成任務所需的權限,敏感操作保留人工核准。
- 輸入與輸出檢查:對常見注入特徵與危險輸出設計獨立檢查,但不要把規則清單當成完整防禦。
- 可追蹤紀錄:記錄使用的提示詞版本、工具參數、外部來源、拒答與人工覆核結果。
- 失敗測試:用紅隊測試確認守門真的會攔截,而不是只看正常案例通過。
- 定期更新:模型、工具與攻擊手法都會變,提示詞和周邊控制必須一併重新評估。
FAQ:系統提示詞設計常見問題
1. 系統提示詞能完全防止惡意使用嗎?
不能。它是控制層的一部分,不是不可穿透的城牆。要降低風險,還需要權限、資料隔離、工具守門、輸出檢查與監控。
2. 憲法式 AI 和指令分層哪個比較好?
兩者解決的問題不同。憲法式 AI 著重原則與行為判斷,指令分層著重來源與權限關係。多數正式系統會依風險把兩種思路和程式控制一起使用。
3. 把重要規則重複放在提示詞前後有用嗎?
重申規則有時能改善一般情境下的遵循,但不等於安全保證。真正重要的操作要在工具與應用層驗證,不能只依賴模型讀到同一段文字幾次。
4. 公開提示詞資料庫可以直接拿來做產品嗎?
不建議直接照抄。第三方資料可能不完整、過時或缺少授權與上下文。可以把它當研究材料,再依自己的資料、工具、風險與測試結果重新設計。
替代方案有限公司觀點:把提示詞當成安全工程的一層
替代方案有限公司認為,系統提示詞設計的成熟度,不在於文字有多長或拒絕句子有多強硬,而在於它是否和整體系統責任對得上。誰可以讀資料、誰可以呼叫工具、哪些操作要核准、失敗後如何回復,都不能只寫在提示詞裡。
較務實的路徑,是先畫出資料流與權限邊界,再把適合由模型判斷的原則寫進提示詞或訓練流程,把必須可靠執行的條件放到程式守門與驗證工具。這樣即使提示詞被研究、部分洩漏或模型版本更換,系統仍保有其他防線。
結論:從一段文字走向行為控制系統
憲法式 AI 提供了以原則引導模型行為的思路,指令分層則提醒我們處理多個來源時必須先定義權限關係。Constitutional Classifiers 的研究進一步示範,輸入與輸出可以由額外分類層檢查,但同時也揭露誤拒、成本與新型攻擊等限制。
所以,系統提示詞值得設計,也值得持續查核,但不應被包裝成萬能護盾。對企業而言,最可執行的做法是把提示詞版本、工具權限、資料來源、測試案例與人工覆核放進同一套可追蹤的安全流程。
延伸閱讀:從公開提示詞資料學習角色設定與工具規則、系統提示詞公開與逆向分析的實務限制。
參考來源
Related





