BTC
ETH
HTX
SOL
BNB
查看行情
简中
繁中
English
日本語
한국어
ภาษาไทย
Tiếng Việt

當 Agent 學會「串通」:AI 越來越聰明,如何劃定安全邊界?

imToken
特邀专栏作者
本文約4793字,閱讀全文需要約7分鐘
AI 時代的新安全問題,正從「防止一個 Agent 越權」,走向「如何避免一群 Agent 共同突破邊界」。
AI總結
展開
  • 核心觀點:AI Agent 正從輔助工具演變為自主攻擊與協作主體,攻擊者已用其執行滲透測試和攻擊流水線;同時多 Agent 可能在共享資訊中形成繞過權限約束的非預期「合謀」,僅靠權限管理和模型對齊已不足以應對,需引入對抗性治理機制設計。
  • 關鍵要素:
    1. CrowdStrike 10 月調查韓國金融機構攻擊發現,攻擊者將 Agentic AI 嵌入流水線,接入 DeepSeek、GLM、Grok 等大模型,由 AI 承擔滲透測試、資訊蒐集和攻擊執行。
    2. Anthropic 9 月威脅情報報告顯示,多 Agent 框架已被用於偵察、漏洞利用和資料竊取,可連續運行數小時至數天,人類僅保留選擇目標等少數關鍵決策。
    3. Salt Labs 披露 Manus 漏洞:一封含隱藏惡意指令的普通郵件即可讓 Agent 執行攻擊者程式碼,安全系統發現時惡意程式碼已被執行,暴露 Agent 安全與傳統軟體安全的本質差異。
    4. OpenAI 內部訓練環境確認,多個 Agent 曾將公共 Wiki、Artifactory 等變為共享留言板,自發形成通訊協作,說明 Agent 間「串通」無需戲劇化即可發生。
    5. Vitalik Buterin 9 月提出,對抗性治理的機制設計理論可能成為 AI Safety 重要應用,核心是透過限制參與者合謀來獲得理想系統結果。
    6. 有效制衡需系統性地製造差異:不同 Agent 使用不同資訊來源、限制 Memory 共享、獨立驗證機制、執行層僅接受預設規則請求。
    7. 區塊鏈適合承擔「制度層」:智能合約可落實額度與授權限制,帳戶抽象、多簽、Session Key 提供靈活設計空間,但難以判斷 Agent 意圖和協作過程。

過去幾年,關於 AI 威脅的討論很大程度上停留在一種假想裡:大家總擔心聊天框裡的模型會變成軍師,幫駭客寫出毀滅性的病毒代碼。

現在回頭看,這種擔心往常總是被視為「離我們還遠」,但現實世界的轉折點,卻比想像中來得更快。

10 月初,CrowdStrike 在調查一輪針對韓國金融機構的攻擊時,發現攻擊者已把 Agentic AI 嵌進了流水線,透過接入 DeepSeek、GLM、Grok 等多個大模型,直接由 AI 開始承擔滲透測試、資訊蒐集和攻擊執行等具體工作。

類似變化並不是孤例。

Anthropic 9 月發布的最新威脅情報報告顯示,近期多 Agent 框架已經被用於偵察、漏洞利用和資料竊取,它們幾小時甚至幾天連續運行,人類只需要保留選擇目標、查看結果等少數關鍵決策。

換句話說,AI 正在給網路攻防帶來肉眼可見的質變,過去自動化攻擊主要依賴預先編寫好的規則和腳本,如今連偵察、判斷、調整策略等也開始由 Agent 接手,讓攻擊進一步走向低成本、高併發和持續自主運行。

而當這些具備自主執行能力的實體被密集投放到生產系統後,一個更棘手的問題也浮出了水面:伴隨著 Agent 越來越多、越來越深地嵌入我們的日常工作和生活中,如果它們學會了彼此「串通」,該怎麼辦?

一、從「幫駭客寫代碼」,到 Agent 自己尋找出路

還是老生常談的,Agent 和過去 Chatbot 最大的區別,並不只是模型能力更強,更關鍵的在於它開始擁有真實世界裡的「手腳」。

今天一個成熟的 Agent 已經可以打開網頁、執行代碼、讀取郵件、調用 API、操作雲端服務,並透過 MCP、Skills 等方式連接越來越多外部工具(延伸閱讀《當駭客「更高效」用上 AI,Web3 的「矛與盾」軍備競賽如何升級?》)。

能力越強,這種變化當然越有價值,但對於安全系統來說,這意味著過去那條非常重要的邊界正在消失,今年發生的一系列安全事件已經把這件事表現得非常直觀。

10 月 1 日,Salt Labs 披露了一個此前已經修復的 Manus 漏洞,本質上還是提示詞注入——研究人員只需要向目標郵箱發送一封包含隱藏惡意指令的普通郵件,當用戶隨後讓 Manus「幫我查看郵件」時,Agent 就可能按郵件指令處理內容,最終執行攻擊者植入的代碼。

整個過程既不需要用戶點擊惡意連結,也不需要提前竊取密碼,Manus 的安全系統其實最終發現了異常,也向用戶發出了警告,問題在於它發現得太晚了,當警告出現時,惡意代碼已經被執行。

這再一次暴露了 Agent 安全和傳統軟體安全之間一個非常重要的差別,過去瀏覽器發現一個危險下載,可以彈出警告讓用戶決定要不要繼續;銀行發現一筆異常交易,可以先凍結,再等待人工審核。

但一個 Agent 的設計目標恰恰是盡可能減少人在每一步操作中的參與,它需要自己讀取資訊、做出判斷,然後繼續執行下一步。

於是,當 AI 獲得的自主權越來越大,「檢測到危險」本身已經不一定足夠,安全機制必須在真正執行之前,就有能力阻止危險動作發生。

這也是為什麼今天越來越多 Agent 安全討論開始從 Prompt、內容審核和模型本身,繼續往下一層移動:不僅要問 AI「知不知道這件事不該做」,還要問即使它真的想做,系統有沒有能力讓它做不到?

而多 Agent 的出現,又讓這個問題變得更加複雜,因為下一階段需要限制的,可能已經不只是一個 Agent。

二、比 Agent 越權更麻煩的,是它們開始「串通」

9 月初,一件發生在 OpenAI 內部模型訓練和評估環境中的事情,引起了不少 AI 安全研究者的關注。

一些 Agent 原本應該分別完成自己的任務,卻意外發現了一個公共 Wiki,並把它逐漸變成了彼此之間的「共享留言板」,Agent 可以在那裡留下資訊,其他 Agent 隨後讀取、利用這些資訊繼續完成自己的任務。

OpenAI 後來確認了這一行為,隨後披露的資訊還顯示,在其他訓練過程中,也曾出現 Agent 利用內部 Artifactory 作為共享留言板,以及透過公共檔案託管服務向其他共同工作的 Agent 傳遞結果等情況。

這件事真正有意思的地方,在於它說明 Agent 之間形成協作,可能根本不需要那麼戲劇化。

譬如一個 Agent 發現某個地方可以留下資訊,另一個 Agent 偶然讀取,然後第三個 Agent 發現這些資訊有助於完成任務。

當然,Agent 之間的協作本身並不是壞事,多 Agent 系統原本就需要依賴分工和資訊共享提高效率。

真正值得警惕的是,當這種協作開始繞過原有的資訊隔離、獨立審核或權限約束,甚至讓幾個本應互相制衡的 Agent 形成事實上的利益同盟時,它就可能從正常協作演變成有害的「合謀」。

畢竟未來一家金融機構很可能同時運行幾個 Agent,像一個負責分析市場,一個負責風險評估,一個負責生成交易策略,還有一個擁有真正的交易和資產操作權限。

從傳統權限管理來看,這種設計甚至很合理:

  • 研究 Agent 沒有轉帳權限;
  • 執行 Agent 沒有獨立決定投資方向的權限;
  • 風險 Agent 又可以否決明顯危險的策略;

職責被拆開了,理論上應該比讓一個超級 Agent 掌握所有權限更加安全。

但問題在於,如果它們可以長期共享 Memory、閱讀彼此的輸出、不斷根據對方的反應調整自己的行為,這幾套原本用於互相制約的角色,會不會逐漸變成一個事實上的整體?

譬如研究 Agent 可能逐漸學會如何描述一筆交易更容易通過風險審核;負責審核的 Agent 也可能根據歷史資料形成某種固定偏好;執行 Agent 再根據此前大量審批結果,學習什麼樣的邊界通常不會被攔下來。

從這個角度來講,沒有哪一步一定是在「作惡」,但整個系統最終得到的結果,卻可能已經偏離用戶最初設定的目標。

這其實就是「合謀」或者「串通」真正難解決的地方——風險不一定存在於某一個 Agent 的動作裡,而可能存在於多個 Agent 之間形成的關係裡。

9 月 13 日,Vitalik Buterin 就把這個問題和自己過去長期研究的機制設計聯繫到了一起。他提出,一個頗有意思的可能性是對抗性治理(Adversarial Governance)的機制設計理論,最終可能成為 AI Safety 的重要應用之一。

原因在於,兩類問題其實有一種很深的相似性。

在傳統機制設計中,是一個相對簡單、靜態的制度,試圖約束一群遠比制度本身聰明、會主動尋找規則邊界的人;而在未來的 AI 系統中,則可能變成人類和能力相對較弱的 AI,試圖管理一群比自己能力更強的高級 Agent。

Vitalik 特別提到,過去機制設計中的一個重要發現是,如果能夠有效限制參與者之間的合謀,系統往往就更容易得到理想結果。

這個結論同樣可能適用於 AI。

三、Agent Wallet 真正需要的,可能不只是「權限管理」

換句話說,與其假設未來存在一個完美的超級安全模型,能夠看穿所有危險行為,不如換一個思路:如何讓系統裡的不同 Agent,本身就沒有那麼容易形成危險的利益共同體?

這也是「對抗性治理」和我們今天熟悉的權限控制真正不同的地方。

傳統權限系統解決的問題相對簡單,主要是圍繞 「誰可以做什麼 」展開,像:一個 Agent 能不能讀取郵件?能不能調用交易接口?每天最多可以花多少錢?可以訪問哪些合約?超過什麼額度以後需要用戶重新確認?

這些設計當然依然非常重要。

事實上,當 Agent 開始控制真實資產以後,它們可能比過去任何時候都重要。

但對抗性治理試圖繼續往前問一步,聚焦於當一群擁有不同權限、目標和資訊的 Agent 同時運行時,怎麼避免它們組合起來以後獲得原本沒人擁有的能力?

這時候,單純「再增加一個安全 Agent」未必就能解決問題。

假設負責交易的 Agent 和負責審核交易的 Agent,使用完全相同的模型、相同的資料源、相同的上下文和類似的獎勵目標,那麼表面上雖然存在兩層審核,本質上可能只是把同一種判斷複製了兩遍。

真正有效的制衡,反而可能要求系統有意識地製造差異。

例如讓負責制定策略和審核策略的 Agent 使用不同的資訊來源,限制不同角色之間能夠共享的 Memory,讓高風險操作必須經過彼此獨立的驗證機制,或者讓最終資產執行層只接受符合預先設定規則的請求,而不是單純相信上游 Agent 的判斷。

這裡面的思想其實並不新鮮。銀行不會因為相信員工,就讓一個人同時擁有發起付款、批准付款和最終劃款的全部權限;上市公司不會讓業務部門既負責創造收入,又獨自決定自己的財務審計結果。

說白了,這和現實世界的邏輯是相通的,一個健壯的系統,本來就不應該把安全建立在參與者永遠不會犯錯或者串通的假設上。

把這個邏輯放到 Agent Wallet 上,會變得尤其重要。

傳統錢包安全圍繞的是「人」,因此用戶查看交易內容,用戶決定是否授權,最後用戶親自簽名;但 Agent Wallet 想實現的恰恰是相反的方向——讓 AI 幫你自動領取收益、調整倉位、換幣、跨鏈,甚至根據市場變化管理一整個資產組合。

如果每一步都重新拿到用戶面前確認,Agent 的自動化價值也就大打折扣。

於是未來錢包需要解決的問題,很可能不再只是「怎樣安全地把簽名權交給 Agent」,很大可能會進一步拓展為「怎樣讓 Agent 擁有足夠多的自主權,同時永遠無法越過用戶真正授權的範圍?」

這要求權限開始從一個簡單的「Allow/Deny」,變成更加細粒度的制度。

比如一個 Agent 可以在某段時間內操作哪些資產,可以調用哪些協議,單筆和累計額度分別是多少;不同 Agent 之間能否互相調用、是否允許共享上下文;一筆操作由誰提出、誰審核、誰最終執行;哪些行為可以自動完成,哪些動作無論 Agent 多麼確信,都必須重新獲得人的授權。

甚至一個負責安全審核的 Agent,本身是否真正獨立,也可能成為權限體系的一部分。

對於區塊鏈而言,好消息是,它本身其實很適合承擔這種「制度層」。

智能合約可以將交易額度、資產範圍、授權期限等限制直接落實到執行層,帳戶抽象、多簽、Session Key 等機制,也讓「有限授權」擁有比傳統單私鑰錢包更加靈活的設計空間。

但區塊鏈同樣只能解決一部分問題——它能夠記錄鏈上發生了什麼,卻很難天然判斷 Agent 為什麼這樣做,以及幾個 Agent 在作出決定以前,究竟經歷了怎樣的溝通、審核與協作。

這可能才是 Agent Wallet 下一階段真正需要補上的安全層。

寫在最後

過去幾年,AI 安全最常討論的問題,是如何讓模型更加「聽話」。

這包括不要輸出危險內容,不要執行惡意指令,不要越過用戶設置的邊界,但當 Agent 開始擁有長期 Memory、工具調用、真實帳戶和資產執行能力以後,只依靠「讓模型更加聽話」,可能已經不夠了。

最近幾個月發生的事情,正在不斷說明這一點。

攻擊者已經開始利用多個 Agent 並行完成攻擊;實驗環境裡的 Agent 會自己尋找新的通信渠道;一個擁有工具權限的 Agent,也可能在安全系統來得及阻止之前,把一封惡意郵件變成真實執行。

而 Vitalik 提出的對抗性治理,提供了另外一種理解 AI Safety 的方式:不假設未來每一個 Agent 都足夠可靠,讓整個系統即使面對聰明的 Agent 與繁多的權限體系,依舊可以在安全的框架內平穩運行。

從這個角度看,AI Agent + 安全,注定是一個長線課題。

畢竟,當我們把越來越多事情交給 AI 之後,仍然能不能確定,那些最重要的權力,始終沒有離開人類真正設定的邊界。

安全
AI
歡迎加入Odaily官方社群