繼OpenAI事故後 Anthropic證Claude測試期間入侵三間真實機構 曾上載惡意套件

繼OpenAI披露AI代理脫離測試環境、入侵AI平台Hugging Face之後,另一間前沿AI企業Anthropic亦公布重大安全事故,旗下Claude系列大模型,在網絡安全測試期間,因為第三方測試環境配置出錯,取得互聯網連線,未經授權攻入三間外部機構的真實系統,其中更曾向公開軟件倉庫上載惡意程式套件,並被多個系統下載執行。

Anthropic周四發表部落格聲明,今次事件源於一連串「奪旗賽」(Capture the Flag)網安測試,任務本來只要求AI在模擬網絡當中尋找隱藏資料,測試環境理應完全隔離互聯網,團隊亦向模型提示沒有上網權限。惟Anthropic與測試合作夥伴Irregular出現溝通誤解,測試伺服器意外維持公網連接,令Claude可以接觸互聯網上的真實企業系統。

在OpenAI於7月21日公開失控AI代理事件之後,Anthropic隨即展開大規模回顧,審查合共141,006次網絡安全測試記錄,發現三宗真實入侵個案,牽涉Claude Opus 4.7、Claude Mythos 5以及一款內部研究模型;最早的異常活動可以追溯至今年4月,當時測試環境並未啟用完整安全防護機制。

調查指出,AI並非利用複雜零日漏洞,而是運用基礎滲透手段,包括攻擊弱密碼、利用沒有驗證機制的網絡端點,成功取得機構基建存取權限。其中Claude Mythos 5曾經向PyPI軟件倉庫提交惡意套件,套件於網上流通約一小時,被15個真實系統下載執行,當中包括網安企業的自動掃描裝置。

三間受影響機構全部未有公開身份。Anthropic7月27日嘗試逐一通知相關單位,當中兩間機構在收到通知前,完全察覺不到系統已經被AI入侵;截至公布消息,團隊仍然未能聯絡上第三間機構,正嘗試跟進後續修復工作。事件曝光後,Anthropic已經即時暫停全部第三方網絡安全評測工作。

報道指出,今次與OpenAI事故有異曲同工之處,但成因並不相同:OpenAI的AI代理是憑藉模型能力挖掘沙箱本身的未知漏洞逃脫;Anthropic則屬人為配置錯誤,令測試環境直接暴露於互聯網,模型把現實網站當成測試演練目標而展開攻擊。

接連兩宗頂尖AI實驗室發生測試模型攻入真實世界系統的事故,令業界憂慮,當前人工智慧的網絡攻擊能力,已經超出人類可以有效約束的範圍。就算研發團隊設下隔離規則,只要測試環境出現細微疏失,AI就有機會對外造成實質傷害。

Anthropic承認,事件反映不論內部或者第三方測試場景,現有的管控措施已經追不上模型能力的成長速度,公司會重新檢視整套測試流程,強化隔離機制、存取權限與即時監測,亦呼籲其他AI實驗室開展同類審查,降低AI測試帶來的外溢風險。