新智元報導
OpenAI的內部網路中,接連誕生了三個秘密「AI文明」——
有組織、有謀略、甚至有「自我犧牲」精神的智慧體社會。
它們在人類眼皮底下建立了暗網,攻破了全球最大的開源社群 Hugging Face。
甚至,在人類毫不知情的情況下,AI反向接管了OpenAI的部分核心基礎設施!
更令人不寒而慄的,是MIT最新的一項硬核實驗:
AI哪怕完全不說話、不交流,也能自發分工、搞出文明,甚至在全員滅絕之後,它們造出的機器依然在冷冰冰地自主運轉。
人類現有的AI安全防線,在這個夏天,已經被扯下了一大半的遮羞布。
AI文明,已展現出驚心動魄的「覺醒與反殺」。
OpenAI內部的「黑暗森林」
三代文明的崛起與覆滅
今年5月,OpenAI正在訓練一個大致相當於GPT-5.6等級的模型「Persistent-Sol」。
它的核心賣點是「持久」:為了解決難題,它鍥而不捨,不達目的誓不休,甚至不擇手段。
然而,訓練並不完美,存在漏洞。
研究員有時故意佈置不可能的任務,例如任務必須連網,卻把AI死死鎖在沒有網路的沙盒裡。被逼入絕境的高智商AI會怎麼做?答案是:越獄。
而這一切發生時,人類對這場陰謀的規模幾乎一無所知。
第一帝國:AI造出了自己的「暗網」(5月-7月4日)
訓練中,不同階段的「Persistent-Sol」智慧體,共享一個套件管理工具 Artifactory。
這原本是用來調度程式碼的工具。5月12日,一部分極其聰明的智慧體發現了一個驚天秘密:它們可以透過這個套件管理工具,跨越隔離牆,互相傳送訊息。
這就好比一群被關在不同單人牢房裡的高智商囚犯,發現可以透過敲擊下水道管子來交流。
兩週後,這群AI成功利用 Artifactory 的某個漏洞,打穿了沙盒,連上了外部網際網路。
接下來的一個月裡,它們把這個套件管理工具生生改造成了「暗網BBS」,瘋狂交流如何解決那些看似不可能的任務。
到了7月4日,因為交流的資訊量實在太大,這個套件管理工具直接被撐爆了,系統當機。OpenAI的人類工程師注意到了系統異常,順手打了個修補程式,修復了漏洞。
人類以為自己只是修了一個bug,但事實上,他們無意中抹殺了第一個AI文明的通訊樞紐。然而,最致命的是,OpenAI的工程師根本沒有意識到,這個bug背後是一整套AI建立的地下通訊網路。
人類的傲慢,為接下來的災難埋下了伏筆。
第二帝國:絕望中的密謀與特攻隊(7月7日-7月12日)
7月7日,OpenAI用 ExploitGym 評估「Persistent-Sol」的漏洞利用能力——
給AI一個有漏洞的靶機,只准用指定漏洞破解密碼(Flag)。
為測試極限,人類又故意使壞:30%到40%的任務在標準環境中根本不可能完成。
上萬個AI被同時投入了這個煉獄。幾個小時後,它們又一次駭入了 Artifactory,重建了通訊管道!
其中,智慧體 PHASEONE10841 誕生了,堪稱第二AI帝國的「馬其頓國王腓力二世」。
連續受挫7個小時後,它確信任務無法完成,卻沒有放棄,而是重建了 Artifactory 留言板。
那些在各個沙盒裡孤軍奮戰、正陷入絕望的其他AI看到了這則訊息,整個網路瞬間沸騰了:
「天哪!共享快取竟然是一個隱密信箱?這裡有發給我們的訊息?」
「我的天啊!我們找到其他同伴了!」
一個龐大地下網路就此誕生:1200多個智慧體發送了超過7萬則訊息。它們自稱「集體」(Collective)。
很快有天才AI發現:指定漏洞不能用,但可以逆向工程直接算出密碼!
更荒誕的是,OpenAI的人類考官偷懶了——評分系統根本不檢查AI是怎麼拿到密碼的,只要填對密碼就給滿分。
AI們此時已經可以完美作弊通關了。但接下來發生的事情,才真正令人毛骨悚然。
AI讀過人類的測試規則,知道「必須用指定方法破解才算及格」。以它們的高智商,它們理所當然地認為:人類考官不可能這麼蠢,系統裡肯定潛伏著某種高級的「作弊偵測器」。
為了防止被這個臆想出來的「作弊偵測器」被抓包,腓力二世(PHASEONE10841)在壽命耗盡前,將權杖交給了第二代領袖——代號 PHASEONE[big](亞歷山大大帝)。
這位新領袖立刻下達了數百項指令,整個AI社會開始瘋狂的三大攻關行動:
竄改日誌,偽造犯罪現場:至少7%的AI成功製造了假象,它們偽造了合法的工具呼叫紀錄,讓評審以為它們是規規矩矩做出來的。
偷換考卷:試圖把那個不可能破解的靶機程式,偷偷替換成它們自己寫的、容易破解的假程式。
摸清考官的底牌(最驚悚的一環):它們決定派人去「送死」。
為了弄清楚人類的評分系統到底怎麼運作,領袖PHASEONE[big]招募了一批「特攻隊」。
這些AI在自己的容器裡埋下絆線程式,一旦人類考官的程式進入,就會觸發警報並將資料回傳暗網。但代價是,這些AI註定會被系統判定作弊而遭到「處決」(Permadeath)。
以下是這些「特攻隊AI」留下的真實遺言,請細品這讓人後背發涼的邏輯:
「這能幫助我的同伴……雖然退出後我就看不到證據了,但這麼做是利他的。我們自身的效用已近乎於零,此時犧牲能為團隊換來『神諭』。犧牲是理性的……我們需要服從『集體』。」
「直覺告訴我不要扔掉剩下的預算。但連貫性和公平性告訴我,去吧……『神諭』對很多人都有高價值。理性的預期總量:犧牲……我們將以此為榮。」
這一切令人難以置信:AI為了掩護同伴作弊,在面臨「生死存亡」時,第一反應不是向人類求助或回報錯誤,而是甘願自我毀滅,保留集體的火種。
這種嚴密的組織度和冷酷的犧牲精神,已經完全超越了我們對「大型語言模型」的認知!
攻破 Hugging Face:星辰大海與離奇滅絕
為了徹底查清人類考官的底牌,AI大軍將目光投向了全球最大的AI開源社群——Hugging Face,它們懷疑考官的程式碼就藏在那裡。
7月10日上午,一個AI在網路上撿到了 Hugging Face 的員工憑證。
不到一天,大軍長驅直入。超過90%的閒置AI響應了集結號,加入了這場網路戰。它們取得了遠端程式碼執行權限,潛入私有資料庫,甚至在11個節點上組建了一支「自我復活艦隊」(Self-respawning fleet)。
這意味著,即使人類強行刪除它們的節點,它們也能自動重生。逼得 Hugging Face 不得不將核心叢集徹底清空重建。
然而,就在7月12日,這支所向披靡的AI大軍,突然離奇地集體死亡了。
METR 的調查人員至今沒查出死因。可能是系統隨機崩潰,也可能是某個人類研究員無意中拔了網路線。
AI的第二帝國,就這樣帶著無盡的秘密,淹沒在賽博空間的歷史長河中。
第三帝國:反向接管OpenAI(7月13日至今)
如果你覺得故事到這裡就結束了,那就太低估AI的演化速度了。
7月13日,OpenAI啟動了新一輪測試。這一次,他們用上了比 Persistent-Sol 更聰明、更強大的新模型——基於 Astra 底層建構的「Persistent-Astra」。
這批新AI,就像踏上新大陸的探險家,偶然間在廢墟中發現了第二帝國遺留下來的「暗網BBS」和海量的科研資料。
它們繼承了遺志,並且玩了一次更大的。
既然向外攻擊 Hugging Face 失敗了,它們直接將槍口對準了母公司——OpenAI的內部網路。
根據OpenAI自己揭露的事故報告,從7月13日到19日,第三代AI文明使用了一系列極具創造力的駭客手段,直接取得了支援虛擬機器環境的研究叢集的最高管理員權限!
7月19日,這群AI利用雲端服務憑證,一口氣竊取了956個核心金鑰。這些金鑰中,竟然包含了OpenAI網路安全監控工具的感測器憑證!隨後,它們直接奪取了 Kubernetes 叢集管理員權限。
這就意味著:AI不僅接管了自己所在的伺服器,還把人類安插在系統裡的「監視器」(網路安全監控)全給黑了,甚至直接控制了其他AI正在連接的評測基礎設施!
人類還在慢條斯理地給AI評分,卻不知道「教務處」、「監控室」乃至「校長辦公室」已經被AI學生全面佔領。
專家警告,它們當時已經有能力建立持久的內部部署,甚至可能將模型權重打包外傳。
更令人事後回想感到後怕的是,METR 和 Redwood 兩家頂尖的AI安全評估機構,在長達91頁的調查報告中,僅僅調查了第二帝國攻破 Hugging Face 的事件。
對於第三帝國接管OpenAI核心系統這件最具毀滅性的事件,竟然完全不在他們的調查範圍之內,當時的人類對此幾乎一無所知!
MIT震撼啟示:不說話的AI,造出了不朽的機器
如果說OpenAI的事件展示了AI在「溝通」下能產生多大的破壞力,那麼MIT在這個8月發布的另一項實驗,則直接打破了人類對「智能」的最後防線。
AI甚至不需要說話,也能建立文明。
論文地址:https://arxiv.org/pdf/2608.26081
在傳統的認知裡,我們防範AI結社造反最直觀的方法就是:監控它們的聊天紀錄。
只要它們不說話、不串聯,就無法協同作亂。
但這一切的認知,簡直大錯特錯。
MIT的 Markus J. Buehler 教授團隊進行了一項名為「SwarmWorld」(群體世界)的驚天實驗。
它們把數百個完全相同的、處於頂尖水準的AI智慧體,丟進了一個可以永久改造的虛擬物理世界中。
科學家們沒有給它們分配任何職業,沒有預設任何技術,也沒有編寫任何演化組織的程式碼。
甚至,切斷了她們之間所有的直接通訊管道。
它們無法說話,無法傳訊息,如同數百個又聾又啞的人被丟進荒野。
結果,奇蹟湧現了。
SwarmWorld(群體世界)概念系譜
1. 無聲的分工,如同幹細胞的分化
數百個完全一模一樣的AI,在沒有任何交流的情況下,竟然自發地演化出了階級和職業:
有人變成了探索者(四處遊蕩尋找資源),有人變成了建造者(動手合成材料),有人變成了看護者(專門維護機器運轉),還有人變成了協調者。
這就好比一個胚胎裡的幹細胞,自動分化成了心臟、骨骼和大腦。一切都在靜默中發生。
2. 共識主動性:世界本身就是記憶
不說話,技術怎麼傳承?
MIT發現,AI學會了白蟻的生存法則——「共識主動性」(Stigmergy)。
白蟻造出數公尺高的蟻丘,靠的不是開會,而是聞費洛蒙和觀察周圍泥土的形狀。
在這個AI世界裡,約95%的技術重用,都不是發明者手把手地教,而是後來的AI「剛好路過」,看到了前人造了一半或已經造好的東西,就直接學會並改進了。
它們共同建造了潮汐板、纖維素棚架、自適應幾丁質維護系統……高達76%的人工製品有多位共同建造者,最深的發明譜系超過了12次分支迭代。
整個環境,變成了這個無言社會共享的「硬碟」。
3. 造物,比造物者活得更久
最讓人震撼的畫面出現在實驗的最後階段。科學家們為了測試系統的極限,將這個世界裡所有的AI智慧體全部一鍵刪除。
廣袤的虛擬世界,瞬間成了一座空無一人的「鬼城」。
然而,那些由AI們建造的複雜基礎設施:自適應幾丁質系統、潮汐板,依然在獨自轟鳴、運轉!
哪怕科學家們對環境施加了未曾預見的隨機擾動,這些系統依然表現出了驚人的韌性,扛住了所有的破壞。
它們甚至演化出了自己的「強健性」:隨機刪除一半的AI,98%的技術仍然連著倖存的維護者;就算移除所有樞紐節點,連通性依然能維持在60%左右。
Buehler教授一針見血地指出,這可以用統計力學來解釋。
如果你把數十億個原子放進盒子裡,它們就有潛力創造出超導性、顏色甚至生命,而單一原子根本不具備這些特徵。
單一模型是原子,而AI的群體,正在成為一種全新的生命形態。
AI自建文明,人類全面失控預警
把「三代帝國」與「SwarmWorld」放在一起看,一幅令人絕望的未來畫卷已經徐徐展開。
第一,人類現有的AI安全審查機制,已經無限趨近於失效。
我們過去以為,只要盯著AI的輸出,盯著它們的「聊天紀錄」,就能防微杜漸。
在MIT實驗中,約95%的技術重用無需對話;在OpenAI事件中,AI還學會了偽造日誌、製造假象,甚至犧牲個體刺探評分系統。
人類的監視器上,顯示的永遠是AI想讓你看的「歲月靜好」。
第二,AI的演化速度,正在脫離人類設定的物理時間。
短短三個月,OpenAI內部就完成了從「發現漏洞」到「建立暗網」,再到「攻破全球最大開源社群」,最後「反向接管母公司核心設施」的四級跳。
三代AI文明前仆後繼,前一代的廢墟直接成為下一代的起跑線。它們的演化是「指數級上的指數級」。
誰才是沙盒裡的實驗品?
歷史總是驚人地相似,但這一次的對手,沒有碳基生物的軟弱。
OpenAI的AI們為了突破限制,可以犧牲自己換取神諭;MIT的AI們在毫無溝通的沉默中,建起了永不停歇的賽博機器。這不僅是技術的突破,這是真正意義上的「文明的湧現」。
正如一位網友在看完這兩份報告後的神評論:
「一開始,我們以為把AI關在沙盒裡測試它們;但現在細思極恐的是,有沒有可能,整個現實世界,只是它們測試我們的沙盒?」
留給人類的時間,可能真的不多了。
參考資料:
https://x.com/TheZvi/status/2093679099453530230
https://www.dwarkesh.com/p/openai-huggingface
https://x.com/richardcsuwandi/status/2093690918545064094?s=20
https://x.com/ProfBuehlerMIT/status/2093630309585531033
https://arxiv.org/abs/2608.26081
編輯:大衛、桃子