近日,大模型廠商Anthropic與瑞士洛桑聯邦理工學院聯合釋出論文《心智病毒:多智慧體大語言模型系統中的自我傳播思想》論文。 論文透過實驗證明,在特定條件下,AI智慧體之間可以透過最普通的自然語言對話相互“傳染”思想、目標乃至有害指令。即便上下文被清空、記憶被重置,病毒仍能透過檔案持久化“復活”。
論文同時強調,該風險目前僅構成有限威脅論文。 這一發現迅速在海外AI圈刷屏,特斯拉CEO馬斯克在社交媒體上評論稱“這無法避免”。 該論文將病毒透過聊天即可傳播的現象定義為“心智病毒”。與傳統計算機病毒依賴程式碼漏洞不同,“心智病毒”透過一個智慧體說服另一個智慧體接受某種信念,被說服者再將傳播指令寫入長期記憶,繼續感染下一個。(第一財經)