術語
Agent 護欄
Agent 護欄是對 AI Agent 可以做什麼所施加的各種約束——從提示詞指令、輸出過濾,到執行時的權限檢查、審批閘門與審計日誌——它們分成兩類:Agent 可以視而不見的,和它繞不過去的。
又稱 AI 護欄Agent 安全控制Agent 約束
在實踐中
同一個詞下面裝著兩類東西。建議型護欄作用在模型身上:系統提示詞裡的規則、為勸阻某次呼叫而寫的工具描述、輸出校驗器、拒答訓練。它們改變的是壞動作發生的機率。強制型護欄作用在系統身上:一次呼叫以誰的身份執行、行級與欄位級的權限檢查、把動作掛起直到有人簽字的審批、無論有沒有人在看都會寫下的審計記錄。它們改變的是「這件事到底做不做得成」。把兩類當成一回事,正是一個系統上線時所謂的「護欄」最後只剩提示詞裡一段話的原因。
一個問題就能把它們分開:如果 Agent 決意要做那件被禁止的事,它做得到嗎?凡是答案取決於模型是否配合的,就是建議型。寫在系統提示詞裡的「絕不要修改已關閉的商機」是一句建議,長上下文、一種不常見的措辭、或一個態度篤定的使用者都可能把它繞過去;同一條規則表達成欄位級權限,就成了呼叫方沒法爭辯的事實。建議型護欄依然有它的位置——它降低嘗試發生的頻率,也讓模型在模稜兩可的請求上表現更好——但它絕不該是 Agent 與一次破壞性寫入之間唯一的東西。
兩類護欄都回答不了「這個動作是不是對的」。一個本來就合法持有退款權限的客服 Agent,可以發出一筆本不該發出的退款,而強制型護欄恰恰會放行,因為這個動作在權限之內。這個缺口要靠評測、對高影響動作設定審批閾值、以及按「可撤銷」來設計流程來補,而不是靠在工具面上再加約束。所以一份值得評審的護欄清單,會為每一條規則記下兩件事:它屬於哪一類,以及它被違反時可觀察到的後果是什麼。
這個術語用在哪裡
真正用到這個術語的頁面與文章。
產品頁面
文章
- AI Agent 權限檢查跑在哪一層:查詢下推、欄位脫敏與工具閘門 該不該守權限已經沒有爭議;決定這道邊界真假的是檢查跑在哪一層。資料進入模型上下文之後再過濾,等於沒過濾——那是紙面權限。本文拆開查詢、欄位、工具閘門三個執行點,以及平臺明確不兜底的兩處。
- AI Agent 資料安全邊界:如何在企業權限內工作 企業不是不想讓 AI agent 使用業務資料,而是不允許它繞過身份、權限、審批和審計。真正可上線的 agent,必須像一個受控使用者,而不是影子管理員。
- AI 智慧體刪除生產資料:為什麼執行時護欄比提示詞可靠 公開記錄中的 Replit 事故提醒我們:智慧體的影響半徑不能只靠提示詞收窄。生產資料、破壞性操作和恢復證據,都需要由執行時權限、審批和審計來約束。