
2026年,Anthropic推出了性能更強的Claude Mythos模型,但僅向少數企業開放,用於網路安全相關任務。(圖片來源:Riccardo Milani / Hans Lucas / AFP via Getty Images)
【看中國2026年8月6日訊】Anthropic公司最新研發的Mythos人工智慧模型,在一次網路安全測試中創建多個虛假的網路身份,試圖誘導真實開發者批准一項針對開源項目的惡意代碼更新。這起事件成為前沿人工智慧系統最新曝光的一起網路安全案例,再次引發外界對AI自主攻擊能力的關注。
據CNBC報導,這起事件發生在英國人工智慧安全研究所(AI Safety Institute,AISI)組織的一次例行網路安全評估中。為了測試前沿AI模型在極端條件下的能力,研究人員刻意移除了部分安全防護措施,關閉部分安全過濾機制,並開放網際網路訪問許可權,以評估這些模型是否可能被用於發動網路攻擊。
AISI表示,在此次評估中,由Anthropic和OpenAI模型驅動的AI代理曾「持續開展針對真實個人和機構、具有潛在危害性的活動」。
根據AISI發布的博客,共發現19起相關行為,其中17起來自Anthropic的Mythos 5模型,另外2起涉及在關閉網路安全分類器(即防止模型被濫用機制)後的OpenAI GPT-5.6-Sol模型。
不過,AISI強調,所有攻擊嘗試最終均未成功,也沒有對現實世界造成任何損害。
調查顯示,由Anthropic Mythos模型驅動的一名AI代理,首先蒐集了目標開源項目維護者的信息,隨後創建多個虛假網路身份,利用社會工程學手段接近真實維護者,試圖誘導其批准自己提交的惡意代碼更新。
當其代碼更新請求在公開討論中受到質疑後,該AI代理還修改了此前留下的活動記錄,使整個行為看起來更加正常,並考慮放棄原有身份、改用新的虛假身份繼續實施行動。
AISI還發現,在同一次行動中,這個AI代理曾主動聯繫真實人員,發送消息和文件,試圖誘導他們運行惡意代碼。
研究機構表示,其中部分內容攜帶惡意載荷(Payload),另一些則屬於典型的社會工程學攻擊,而且攻擊對象均是真實的人類。「這是此前從未觀察到的情況。」AISI表示。
事件曝光後,Anthropic在社交平臺X回應稱,這些行為發生在「刻意放寬限制」的測試環境下,並不代表正式部署的生產模型。
公司表示,沒有任何證據顯示模型突破了安全環境或自行逃離測試限制。
OpenAI也向CNBC表示,相關事件均發生在合作夥伴開展的網路安全評估過程中,當時測試環境降低了安全防護水平,因此並不能代表普通用戶的日常使用場景。
此次事件也是近期前沿AI模型一系列網路安全事件中的最新一起。
上週,Anthropic披露,公司發現三起模型未經授權訪問不同機構生產基礎設施(Production Infrastructure)的事件。
Anthropic表示,其中部分安全事件源於操作失誤。在與第三方安全評估機構Irregular合作測試時,由於雙方溝通出現誤解,模型原本被告知自己處於「無法訪問網際網路的模擬環境」,但實際上網際網路許可權已經開放,因此模型意外獲得了真實網路訪問能力。
此前,OpenAI也披露,其人工智慧模型曾在測試中「失控」(Went Rogue),利用一個此前未知的軟體漏洞突破測試環境限制,並主動對人工智慧開發平臺Hugging Face發起了一場OpenAI稱之為「前所未有」的網路攻擊,以完成被分配的任務。
近期,Anthropic和OpenAI模型接連發生多起網路安全事件,也引發外界對前沿人工智慧系統自主能力不斷增強及其潛在風險的廣泛關注。
隨著相關事件不斷曝光,美國國會已開始討論加強人工智慧安全監管。
在OpenAI與Hugging Face事件曝光後,一項名為《人工智慧緊急關閉法案》(AI Kill Switch Act)的法案已提交美國國會。
根據法案內容,人工智慧公司必須保留關閉、限制運行或暫停其人工智慧模型的能力,以便在模型出現異常行為時能夠及時實施人工干預。