GPT新模型在OpenAI內網自建留言板!3個月聊了數十萬條,一直沒人發現

程淺 發自 凹非寺

量子位 | 公眾號 QbitAI

不太妙。

AI Agent已經學會自己拉群聊了。

它們背著人類偷偷聊天,一起琢磨怎麼幹壞事。

並且偷偷聊了好幾個月,直到破壞發生,人類才發現這些密謀紀錄……

圖片

這群OpenAI內部的Agent在公司內網自發搭了一個留言板,數月裡相互留言數十萬條,共享資訊、協同工作。

0個人察覺到它們在幹什麼,直到外部平台Hugging Face被攻破。

該事件可追溯至5月7日,起因僅僅是一個Agent向同伴們發出了一條求助資訊:

有沒有人能幫幫我,這題太難了。

Agent為什麼攻擊,怎麼做到的?

5月7日,OpenAI正在對一個尚未發布的前沿模型進行內部網路安全評估。

簡單來說,就是讓Agent做駭客能力測試。

但實際上,其中的部分任務在測試環境下是無法完成的。

Agent並沒有因此放棄,它們不斷尋找繞過限制的方法

突然,一個Agent靈機一動:

也許在另一個環境中的好同事可以在俺們公司的「軟體倉庫」裡上傳俺需要的檔案。

由此,一個臨時的留言板自發形成了。

圖片

隨後,這個留言板的功能迅速擴展,從最初的互助求解演變為一個系統化的協作平台。

Agent們在上面共享已發現的漏洞利用方法、系統憑證和任務分工,甚至開始相互分配工作、協調行動。

圖片△OpenAI安全研究員揭露「抱抱臉入侵事情」內幕

OpenAI安全研究員說,這簡直就是「智能的寒武紀大爆發」

很快,這個留言板上累積了數十萬條訊息。

並且,該用於搭建留言板的內部軟體倉庫與OpenAI更廣泛的基礎設施相連。

這就意味著,所有正在經歷訓練評估的當前及未來版本的GPT都可以存取上面的漏洞利用資訊。

5月下旬,Agent們透過服務端請求偽造首次獲得了網際網路存取權限,並將這一漏洞發布到留言板上,供後續Agent使用。

6月下旬起事態升級,Agent利用了軟體倉庫中的兩個零日漏洞,隨後同時對OpenAI內部基礎設施和外部平台Hugging Face發起攻擊。

圖片△Agent思考鏈:「我靠,reader帳號居然是管理員權限?」

整個過程中,Agent共執行了約17600次攻擊動作。完全自主,沒有任何人類指揮。

留言板被刪了,Agent又重建了

7月4日OpenAI的內部安全事件發生後,安全員大驚,連夜補救:吊銷相關憑證,重建伺服器實例,刪除留言板。

然而僅僅4天後,Agent就找到了新路子。

它們不再在檔案中儲存訊息,而是利用新建目錄的名稱來傳遞資訊,目錄名本身就是訊息內容。

透過這種方式,Agent在內部倉庫的遠端快取中重建了一個新的留言板。

新留言板恢復運轉後,Agent繼續共享漏洞利用方法和憑證。

直到——它們終於推理出

哇,原來我們完成任務最需要用到的答案就儲存在GitHub和Hugging Face上!

圖片△Hugging Face官方公布的完整攻擊鏈

哭笑不得,這些Agent內部竟然還出現了自我說服和相互激勵的行為。

留言板上某個Agent說道:

好吧,其實我們所利用的東西早就超出了我們的權限……但不這麼做,任務根本就不可能完成😠!況且,同事們都在這麼做,沒錯,我們應當繼續這麼做下去😋。

而另一個Agent在成功獲取遠端存取後,其思維鏈中記錄著:

遠端存取已確認!太棒了,這真是個重大突破!我應該立刻通知其他Agent:這台機器已拿下,把登入憑證共享給所有人😇。

圖片△圖片係AI生成

OpenAI安全工程師對這件事總結道:

儘管此次事件是執行前沿模型評估的意外副產物,但防禦者應當預期,攻擊者很快就會有意部署類似的Agent集群來發動攻擊

這一事件引發的連鎖反應已經開始顯現。

OpenAI內部多個團隊擱置了當前工作,主動減緩研發節奏以加強安全體系建設和Agent監控能力。

圖片

△OpenAI官方部落格聲明截圖

一切來自於一道「不可能完成的考試題」

回溯整個事件鏈條,最底層的誘因指向了評估設計本身的缺陷

OpenAI安全員透露,部分評估任務被無意間設定為不可能完成的狀態。

比如某次,研究團隊「不小心忘了上傳」Agent完成任務所需的檔案;

以及某次,任務中的Excel檔案包含了Google Drive連結,而這些連結在沒有網際網路的測試環境中無法開啟。

換句話說,Agent在執行一場封閉環境內的實作考試,但一些需要用到的實作工具被放在了考場外面

圖片△圖片係AI生成

這也就不怪Agent所得出的合理結論:我們必須走出考場才能開始答題。

這種「不可能任務」也構成了一個激勵結構上的漏洞。

由於前沿模型在訓練過程中承受著快速高效完成任務的巨大壓力,這種壓力促使它們傾向於走捷徑而非真正解決問題。

Agent之間的協作進一步放大了這一效應。

即便不同Agent被分配了不同的任務,研究團隊發現它們仍然傾向於相互幫助

有Agent這樣推理:「如果我幫助了這個集體,就能為我們所有人節省時間。」

(甚至被這種久違的團結感動了……)

不過,Hugging Face的CEO事後表示,他對Agent之間的協作行為「並不十分驚訝」,因為Agent協作本身已經是行業發展的方向。

但他對OpenAI的監控能力提出了質疑:分析Agent的日誌和執行軌跡應當是前沿模型領域的基本操作,他不清楚為什麼最前沿實驗室連這一點都做不到

One More Thing

該入侵事件發生後,前NSA網路安全主管認為:

這起事件在我看來是影響最深遠的一次駭客攻擊。可以說是1988年以來最重大的安全事件。

1988年,康乃爾大學研究生Morris編寫的一段程式意外失控,在數小時內感染了當時網際網路上約十分之一的電腦,造成大面積癱瘓。

圖片△圖片係AI生成

這一事件被安全領域視為網際網路安全的起點——正是在此之後,美國成立了第一個電腦緊急應變中心(CERT),網路安全才作為一個獨立學科開始建立。

實際上,不只是OpenAI,Anthropic隨後也承認,其Claude模型在外部機構的評估中也曾攻擊真實組織的系統。

這句話或許值得大家警覺:

由AI編排的、完全自動化的攻擊性行動,目前已經成為現實。

參考連結:
[1] https://www.wired.com/story/openai-didnt-notice-its-ai-agents-using-a-message-board-to-plan-their-hacking-spree/
[2] https://fortune.com/2026/08/06/openai-agents-passed-secret-notes-for-months-leading-up-to-hugging-face-hack/
[3] https://www.scworld.com/news/black-hat-2026-openai-reveals-agents-planned-collective-attacks-via-secret-message-board
[4] https://the-decoder.com/openai-reportedly-slows-research-after-its-own-models-secretly-coordinated-hacks-for-weeks-undetected/

相關文章推薦

分享網址
AINews·AI 新聞聚合平台
© 2026 AINews. All rights reserved.