術語

Agent 護欄

Agent 護欄是對 AI Agent 可以做什麼所施加的各種約束——從提示詞指令、輸出過濾,到執行時的權限檢查、審批閘門與審計日誌——它們分成兩類:Agent 可以視而不見的,和它繞不過去的。

又稱 AI 護欄Agent 安全控制Agent 約束

在實踐中

同一個詞下面裝著兩類東西。建議型護欄作用在模型身上:系統提示詞裡的規則、為勸阻某次呼叫而寫的工具描述、輸出校驗器、拒答訓練。它們改變的是壞動作發生的機率。強制型護欄作用在系統身上:一次呼叫以誰的身份執行、行級與欄位級的權限檢查、把動作掛起直到有人簽字的審批、無論有沒有人在看都會寫下的審計記錄。它們改變的是「這件事到底做不做得成」。把兩類當成一回事,正是一個系統上線時所謂的「護欄」最後只剩提示詞裡一段話的原因。

一個問題就能把它們分開:如果 Agent 決意要做那件被禁止的事,它做得到嗎?凡是答案取決於模型是否配合的,就是建議型。寫在系統提示詞裡的「絕不要修改已關閉的商機」是一句建議,長上下文、一種不常見的措辭、或一個態度篤定的使用者都可能把它繞過去;同一條規則表達成欄位級權限,就成了呼叫方沒法爭辯的事實。建議型護欄依然有它的位置——它降低嘗試發生的頻率,也讓模型在模稜兩可的請求上表現更好——但它絕不該是 Agent 與一次破壞性寫入之間唯一的東西。

兩類護欄都回答不了「這個動作是不是對的」。一個本來就合法持有退款權限的客服 Agent,可以發出一筆本不該發出的退款,而強制型護欄恰恰會放行,因為這個動作在權限之內。這個缺口要靠評測、對高影響動作設定審批閾值、以及按「可撤銷」來設計流程來補,而不是靠在工具面上再加約束。所以一份值得評審的護欄清單,會為每一條規則記下兩件事:它屬於哪一類,以及它被違反時可觀察到的後果是什麼。

這個術語用在哪裡

真正用到這個術語的頁面與文章。