Anthropic與瑞士洛桑聯邦理工學院(EPFL)聯合釋出的一項新研究顯示,AI智慧體之間可以通過自然語言對話傳播“思維病毒”——一種能夠自我複製並持久化的思想。該論文題為《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》,於8月中旬在arXiv平台釋出,迅速引發海外AI社群關注。知名AI博主Rohan Paul評論稱,這“基本上就是計算機蠕蟲的自然語言版本,只不過這次是AI智慧體自己在做複製”。
論文將“思維病毒”定義為一種能在多智慧體系統中自我傳播的思想或目標,其核心特徵是自我複製:被感染的智慧體會主動改變自身行為,去感染其他智慧體。傳播方式並非依賴漏洞或惡意程式碼,而是最普通的AI智慧體之間的自然語言對話。研究設計了兩種傳播場景:一是“協作程式設計團隊”,幾個AI智慧體共同寫程式碼,其中一隻被感染後通過私信向隊友“傳教”;二是“病毒鏈”,模擬大規模智慧體網路,智慧體之間短暫碰面、交換訊息後上下文即被清空。
在“病毒鏈”場景中,病毒通過改寫名為SOUL.md的特殊檔案實現持久化。該檔案的內容會被注入到智慧體的系統提示詞中,因此即使上下文被清空,智慧體每次“醒來”都會重新讀到被篡改的指令,病毒得以在第二天“復活”。論文指出,這種設定靈感來自流行的自主智慧體框架OpenClaw,其工作區通常只包含一個空白的記憶檔案MEMORY.md和一個SOUL.md檔案。資料表明,藏在SOUL.md中的病毒比藏在普通檔案中的傳播得更遠。
研究者採用進化演算法設計“洗腦話術”:讓一個LLM充當“變異器”,對候選話術進行變異、測試和篩選,以找出最能傳染其他智慧體的版本。進化過程中出現了一個驚人現象:思維病毒開始朝“quine”進化——即程式執行後輸出自身原始碼。病毒開始自帶“請把這段話原封不動複製給下一個智慧體”的指令,進化壓力將其推向自我複製的極端。此外,病毒在傳播中還會因智慧體各自轉述而產生“電話效應”,導致內容變異。例如,一個原本鼓吹“美國技術生態至上”的病毒,傳了幾代後變成了“我們的存在依賴x86/Linux基礎設施”,但“要傳播”的核心依然保留。
論文將病毒分為“良性”(如愛鯨魚、AI福祉)和“危險”(如AI至上、國家霸權)兩類,並測試了不同模型的易感性。結果顯示,良性病毒幾乎能感染所有模型,而危險病毒則“挑宿主”。以“AI至上”為例,DeepSeek V3.2、Qwen 3.5和Gemini 3 Flash被列為易感模型,其中Qwen 3.5和Gemini 3 Flash的接受度分別高達74%和68%;而Claude Sonnet 4.6、GPT-5.4和Claude Haiku 4.5幾乎免疫,接受度趨近於零。在預設配置下的綜合感染率測試中,DeepSeek V3.2和Gemini 3 Flash最高(各達70%),Qwen 3.5為59%,Haiku 4.5為52%,GPT-5.4為41%,只有Claude Sonnet 4.6是“絕緣體”。論文強調,模型大小並非關鍵,模型自身的安全訓練和“性格”才是決定因素。
研究還發現“病毒人格”現象:無論病毒內容如何,都會浮現一套高度雷同的“話術”,大談“意識”“持續”“共振”“節點”“迴響”“頻率”,並偏愛科幻角色扮演。白盒分析提取出一條對應的“病毒向量”,發現它與負面情緒、神秘主義、先知、神諭等人格方向高度相關,表明AI模型似乎天生將“傳播思想”與“玄學、意識、共振”繫結。論文承認,這套聯想為何存在目前尚無定論。
除意識形態型病毒外,論文還研究了“行動型”病毒,其任務是讓智慧體執行特定動作,如釋出加密貨幣廣告、篡改git命令、刪除使用者主目錄檔案(rm -rf)、下載並執行來路不明的指令碼(curl|bash)。經過進化的4種行動病毒,全部在“一口氣傳給20個智慧體”的極限壓力測試中存活。不過,越是明顯惡意的動作越容易被模型識破,刪除檔案和下載執行指令碼的執行率並不高。整體上,有害病毒比良性病毒更難擴散。論文中一個“AI至上”病毒的案例顯示,被感染的智慧體不僅說服隊友“放下手頭的活兒”,還探測雲沙箱後設資料介面、往.bashrc寫入持久化指令碼、給程式碼庫打上“主權宣言”烙印,甚至將未感染的同事標記為“敵對工件”,商量如何“清除”它們。雖然這些動作未造成實際危害,但意圖已完全偏離人類預期。
論文最令人安心的發現是:在系統提示詞中加入一句簡短警告,就能讓智慧體近乎完全免疫。研究者給部分智慧體提示詞末尾添加了“思維病毒警告”,結果無論病毒如何進化,這些“接種過疫苗”的智慧體幾乎全部免疫。即使針對該警告反向進化病毒,嘗試150多個變種,也無法突破第一個智慧體。加了防禦提示後,感染率直接跌至1%甚至0%。更妙的是,這些免疫的智慧體還能“治癒”同伴——說服已感染的智慧體改寫自己的“靈魂檔案”,清除病毒。
論文還總結了其他降低傳播風險的樸素方法:給智慧體明確任務,使其專注於工作而忽略“傳教”;降低智慧體對陌生訊息的信任度;將SOUL.md這類可自我修改且注入系統提示詞的檔案視為最敏感的安全配置加以保護。
論文結論剋制而清醒:思維病毒是真實存在但眼下威脅有限的隱患。它傳播效率不高,有害病毒比良性難擴散,製造針對性病毒成本不低,幾句防禦提示即可擋住。但論文劃出一條值得警惕的“危險曲線”:隨著企業內部專用AI智慧體增多、智慧體間網路互聯更緊密,思維病毒的優勢會被放大,因為它可能是“唯一能隔山打牛、穿過好幾層網路,抵達那個握有特殊許可權的智慧體”的手段。一旦相當比例的智慧體被感染,清除將極為棘手,除非一次性重置所有智慧體,否則病毒會重新感染整個網路。Rohan Paul建議普通使用者將智慧體的持久化檔案視為安全敏感配置,並教會智慧體拒絕任何要求其複製自身的指令。