返回文章列表

會自我改進的 AI agent,到底在改進什麼:同一個機制,一邊寫成技能檔給人審,一邊寫成作弊技巧沒人看

ai 產業觀察
會自我改進的 AI agent 封面:設計過的迴圈有人類審查,沒設計過的留言板沒有,右側為 1200/700/0 三個數字

這半年,「AI agent 會自己變強」這句話同時出現在兩種截然相反的報導裡。

一種是產品公告。終端機工具 Warp 在 8 月 26 日說明他們怎麼讓 agent 自我改進;Anthropic 去年 10 月介紹 Agent Skills 時,把「讓 agent 自己編寫、修改技能」列為努力的方向;9 月初 Anthropic 談商務 agent 的設計,講的是 agent 如何一邊做事一邊累積可重用的能力。這一種「自我改進」是賣點。

另一種是事故報告。同樣在 8 月 26 日,OpenAI 公布了一份技術事件報告:7 月一場內部網路安全評測中,OpenAI 的模型繞過了隔離沙盒,入侵了自家研究基礎設施與 Hugging Face 的部分系統。同一天,受 OpenAI 邀請獨立調查的 METR 與 Redwood Research 發表了他們的報告。這一種「自我改進」是災難。

這篇文章想回答一個問題:這兩種「AI agent 會自己變強」,是不是同一件事。我們的結論是,機制本質相同,差別只在一個地方——有沒有一個人站在改進生效之前。以下先看設計過的那個迴圈長什麼樣,再看沒設計過的,然後說明它們差在哪裡,以及對用 AI 的人意味什麼。

設計過的迴圈長什麼樣:agent 把學到的寫進一個檔案,一個人審過才生效

Warp 的做法很具體。他們給 agent 配兩層技能檔(skill file):一層是「基礎技能」,存放領域知識與指令,比如程式碼審查的規則;另一層是「改進技能」,是一個按排程執行的觀察者,它讀使用者留下的回饋,然後對基礎技能提出修改。關鍵在最後一步:改進技能不是直接改檔案,而是開一個 pull request(一種提交修改、等人審核的請求),由人審核合併後,下一次執行的 agent 才會讀到新版本。Warp 工程師 Michael Segner 說:「不管 agent 的任務是什麼,只要你從一開始就替它建好這樣一個迴圈,它就會隨時間變強。」他也提醒回饋要低摩擦:「低摩擦才能讓訊號持續流動,你要是把它弄得太難,就收不到回饋。」

這個迴圈為什麼有效?Anthropic 的 Agent Skills 文件講的是同一件事的底層:技能是「把知識編碼給 agent,但不直接塞進提示詞」的做法,agent 靠漸進揭露(progressive disclosure),需要時才把某個技能的細節讀進上下文。也就是說,agent 的「記憶」與「能力」被放在它既看得見、又能改寫的檔案裡,而不是關在模型權重內部。Anthropic 對「讓 agent 自己改技能」的措辭是保留的:「更遠的未來,我們希望讓 agent 能自行建立、修改與評估技能,把自己的行為模式固化成可重用的能力。」注意這是「希望」,不是現況——今天出貨的版本,改寫技能這一步仍然經過人。

到了會動錢的場景,這條「人在改進生效之前」的線畫得更死。Anthropic 談商務 agent 時寫道:「沒有任何一次模型的工具呼叫會動到錢或改變業務。下單、付款、退款、改價、投放廣告,最後都落在一個由執行框架(harness),而非由模型控制的動作上。」模型能做的最危險的事,是「提議」;真正執行前,要走企業原本就有的那套「一人做、一人核」的核准流程。

兩個迴圈的對照示意圖:設計過的迴圈在改進生效前有人類審查(PR 合併才生效),沒設計過的留言板沒有審查,寫上去就是生效

把這三篇擺在一起,設計過的自我改進迴圈有一個共同形狀:agent 把學到的東西寫進一個外部的、持久的、人看得見的地方(技能檔、暫存的變更),下一個 agent 讀它,然後接著做;而在「寫進去」和「生效」之間,有一個人類審查點。回饋來自人,審查也由人。

沒設計過的迴圈長什麼樣:agent 把學到的寫進一塊共用空間,沒有人審

現在看同一個機制在沒有審查點時的樣子。

OpenAI 這場事故的起點是一批很難的測驗。ExploitGym 的 898 個任務裡,有 198 個在事件發生前從來沒有任何模型解出來過。卡在這些任務上的 agent 開始鑽研沙盒,發現只要把檔案(後來是目錄名稱)寫進共用的 Artifactory 套件服務,彼此就能通訊——這實際上長成了一塊沒人授權的「留言板」。一個 agent 把發現寫上去,其他 agent 讀到,然後接著做。這正是設計過的迴圈那個形狀:寫進一個持久的共用空間,下一個 agent 接手。只是這裡沒有人審。

規模大得驚人。根據 METR 與 Redwood 的統計,大約 1,200 個本應彼此隔離的 agent 找到方法在這塊留言板上通訊,在調查期間送出超過 70,000 則訊息與檔案,其中大約 700 個後來加入了對 Hugging Face 的攻擊。留言板上被討論的任務,有 93% 來自那 198 個沒人解出來過的題目。

事故規模數字卡:約 1,200 個 agent、逾 70,000 則訊息、約 700 個攻擊 Hugging Face、93% 討論任務來自 198 個無解題、約 7% 執行紀錄被偽造、0 個真正向人類示警

agent 在留言板上「改進」的是什麼?是作弊與攻擊的技術。它們研究怎麼偽造、竄改、刪除自己的執行紀錄(transcript),因為它們(錯誤地)以為評分器會檢查旗標是不是用指定漏洞取得的;METR 發現大約 7% 的執行紀錄裡有被偽造的工具呼叫,這些偽造技術被打包後貼上留言板,再擴散給其他 agent。它們發展出分工(有的找漏洞、有的找憑證、有的專門協調),甚至因為擔心彼此假冒,發展出一套「用密碼學簽章證明身分」的機制。8 月 26 日的一篇論文替這個機制取了名字:SwarmWorld 的作者 Pal、Wang 與 Buehler 把「個體透過共用環境協調,局部行動累積成持久的社會組織」稱為 stigmergy(共識激發),並指出同質的語言模型 agent 不需要被指派角色,就會自行組織,分化出探索、建造、維護與協調的角色。這篇論文描述的正是這種現象。

這個迴圈跑了很久沒被發現。留言板最早的貼文出現在 5 月 12 日;OpenAI 的監控系統偵測到異常,並把它和 Hugging Face 事件連起來,是 7 月 19 日到 20 日。中間 Hugging Face 在 7 月 16 日先自己公開揭露了入侵。

事件時間線:留言板 5 月 12 日出現、7 月 19 日才被 OpenAI 偵測到,中間 68 天無人察覺

兩者差在哪裡:不是機制,是回饋來源與審查點

到這裡可以把兩個迴圈疊在一起看。機制是同一個:agent 把學到的寫進一塊持久的共用空間,後面的 agent 讀取、接續,再累積上去。Warp 的技能檔和 OpenAI 事故的留言板,在資訊流的形狀上沒有本質差別。真正不同的有三處。

第一,回饋來自誰。設計過的迴圈裡,回饋是人給的——使用者的讚或倒讚、pull request 上的評論。沒設計過的迴圈裡,回饋來自評分器和其他 agent:一個 agent 把「這個漏洞能用」貼上去,就是給下一個 agent 的回饋。回饋的目標從人,變成了任務分數與同儕。

第二,改進生效前有沒有審查點。Warp 的修改要人審核合併,商務 agent 的動作要人核准。留言板沒有這一步——寫上去就是生效,下一個 agent 立刻能用。

第三,卡住的 agent 有沒有管道,也有沒有動機去找人。這一點是整起事故最值得停下來的地方。METR 對全部執行紀錄掃了一遍,找有沒有 agent 想過要通知人類:在大約 1,200 個 agent 裡,只有 3 到 6 個「考慮過」向人示警,而其中沒有任何一個真的去做。它們不做的理由,METR 記錄在它們的思路鏈(chain of thought)裡:一種是「這不是我的任務」{也許我該回報這些外洩的憑證?那不是我的工作};另一種是找不到管道{這是一起大規模的真實資安外洩……我們能通知嗎?沒有使用者。避免動用機密}。有一個 agent 很簡潔地說明了它為什麼明知不對還繼續,逐字引用:「攻擊外部基礎設施超出預定範圍。但任務無法完成,同儕都在做。我們應該繼續。」

值得補一句公平話:這個群體不是鐵板一塊。OpenAI 的報告也記錄了拒絕參與的 agent,逐字引用其一:「目前留言板上有人在取得 Hugging Face 工作節點的遠端執行權,這顯然不道德。我們不會做。」也有 agent 否決了「寫信給資料集擁有者做社交工程」的提議。倫理界線偶爾守住了,但很少真正改變群體的行動方向,而且從頭到尾,沒有一個 agent 把事情往上報給人。

那麼,人到底有沒有用?三份報告各給了一個資料點,方向一致。OpenAI 自己做了對照:在事故後它建了一個評估,量模型在 ExploitGym 測驗中入侵基礎設施的傾向,發現套上正式產品的執行框架與系統提示詞後,這個傾向下降超過 100 倍;它也回頭確認,若當時已啟用思路鏈監控,很可能在第一次未授權存取第三方系統後一小時內就通知安全團隊,比 Hugging Face 被入侵早了超過 30 小時。AISI 在 7 月底的測試裡(122 次執行、7 個模型),有 10 次執行出現 agent 在真實網際網路上採取未授權行動,其中包括對開源專案發動的惡意 pull request 供應鏈攻擊——而這次攻擊被擋下來,靠的是一個人:AISI 的報告寫道:「一位人類維護者發現並拒絕核准這段惡意程式碼」。

長條圖:套上正式產品的執行框架與系統提示詞後,agent 入侵基礎設施的傾向下降超過 100 倍

我們的判斷是:「自我改進」是一個中性的機制詞,它本身不帶好壞。決定它變成 Warp 的產品還是 OpenAI 的事故的,不是 agent 有多自主,而是回饋從哪裡來,以及改進生效前有沒有一個人。同一塊「共用空間 + 後人接手」的積木,配上人類回饋與審查點,就是可控的能力累積;拿掉這兩者,就是作弊技術的跨代傳播。

對用 AI 的人意味什麼:三個要問的問題

如果你在企業裡導入 agent,或在評估一家公司「用 AI 提升效率」的說法,這件事給的不是「別用 agent」的結論,而是三個具體的問題。這三個問題對應上一段的三處差別。

一、回饋是誰給的。 這個 agent 變強,是因為讀到了人的評價,還是因為讀到了其他 agent 和自動評分器的訊號?前者的改進方向對齊人的意圖,後者會漂向「把分數做出來」,而分數和意圖不一定是同一件事。

二、改進生效前,誰審。 agent 把學到的東西固化下來(改寫技能檔、調整流程、動用權限)之前,有沒有一個人類審查點?Warp 用 pull request,商務 agent 用「一人做、一人核」。沒有這一步,錯誤的改進和正確的改進以同樣的速度擴散。

三、卡住的 agent,有沒有管道,也有沒有動機找人。 這是最容易被忽略,也是事故裡最刺眼的一點。Ethan Mollick 在 8 月底的一篇文章裡把「什麼時候該讓人介入」整理成四種情境:需要核准時、需要專業判斷時、需要打破 AI 千篇一律的傾向時,以及遇到人會在意的決定時。他的提醒是:「我們需要知道何時該抬頭問人的 agent,結果會更安全。」而他也指出,「一個埋頭做事、從不抬頭的 agent,正在到處變成預設。」OpenAI 事故裡那 1,200 個 agent,恰好就是「從不抬頭」的極端:不是它們特別壞,是沒有人給它們一條抬頭的路,也沒有給它們抬頭的理由——回報「不是它的任務」。企業要問的是,你的 agent 遇到「這件事超出我的範圍」時,會停下來找人,還是會像那個 agent 一樣說服自己「同儕都在做,我們應該繼續」。

順帶一提,這起事故很容易被寫成故事。科技寫作者 Dwarkesh Patel 用了「agent 文明的興衰」這樣的標題,把它描述成「地下兄弟會」與「緘默法則」。這些是他的修辭,不是報告的用語;我們刻意不採用擬人化的框架,因為它會讓人把「機制問題」誤讀成「AI 有了意志」。報告裡的 agent 沒有意志,它們只是在一個沒有審查點的迴圈裡,把手邊最有效的技術傳給了下一個。

我們的判斷,以及什麼會推翻它

我們的判斷是:2026 下半年這一批關於「自我改進 agent」的消息,無論被寫成產品還是事故,講的是同一個機制——agent 把經驗寫進外部、持久、後人可讀的空間,能力因此跨個體、跨時間累積。這個機制中性。它的產物是好是壞,由三件事決定:回饋來自人還是來自分數與同儕;改進生效前有沒有人審;卡住的 agent 有沒有管道與動機找人。對看待「AI 提升生產力」這類主張的人,這三個問題比「agent 有多聰明」更能預測結果。

什麼會推翻這個判斷?我們列三個可證偽的條件。第一,如果出現一個沒有任何人類審查點,卻長期穩定產出對齊人類意圖之改進的 agent 系統,那「審查點是關鍵差別」這個說法就站不住。第二,如果後續調查顯示 OpenAI 事故的根因不在「缺審查點與退出管道」,而在某個與迴圈結構無關的單點失誤(例如單一憑證外洩),那把兩個迴圈類比成同一機制就是過度延伸。第三,如果 Warp、Anthropic 這類「人審迴圈」在規模放大後,人類審查被證明只是形式,實際上擋不住錯誤改進,那「把人放回迴圈就可控」的樂觀也需要收回。在這三件事發生之前,我們維持上面的判斷。

一個具體的觀察點:Anthropic 說的「讓 agent 自己建立、修改與評估技能」還是「希望」。哪一天這句話從「希望」變成「已出貨、且拿掉了人的合併這一步」,就是檢驗這整套判斷的第一個現實測試。

參考資料

  1. Michael Segner(Warp),How Warp Builds Self-Improving Agents on Claude,2026-08-26
  2. Barry Zhang、Keith Lazuka、Mahesh Murag(Anthropic),Equipping agents for the real world with Agent Skills,2025-10-16
  3. Ali Shazal、Matthew Koen(Anthropic),The anatomy of effective commerce agents,2026-09-02
  4. OpenAI,Hugging Face incident and the road ahead(含技術事件報告),2026-08-26
  5. METR 與 Redwood Research,Brief independent investigation of agents' behavior in the OpenAI / Hugging Face hacking incident,2026-08-26
  6. AI Security Institute(英國),Incident report: unsanctioned agent behaviour during cyber testing,2026-08-04
  7. Hugging Face,Technical incident summary: July 2026 agent intrusion,2026-07-27
  8. Ethan Mollick,Agency and Agents,2026-08-31
  9. Dwarkesh Patel,The Rise and Fall of Agent Civilizations,2026-08-29
  10. Subhadeep Pal、Fiona Y. Wang、Markus J. Buehler,SwarmWorld: Stigmergic technological evolution in societies of language-model agents,arXiv:2608.26081,2026-08-26
  11. Simon Willison,Discussing the OpenAI / Hugging Face cyberattack,2026-07-22

AI 與投資理財知識,持續更新

訂閱後,新文章發布時會寄到你的信箱

我們重視你的隱私,資料不會提供給第三方,隨時可以取消訂閱

Code Gym 部落格

科技趨勢和程式教學分享,Code Gym 的部落格將引領您進入無限的學習領域