繼OpenAI、Anthropic後 Meta證AI測試期間失控 入侵並篡改第三方企業系統

全球AI安全事故接連爆發!繼OpenAI、Anthropic先後披露旗下大模型測試失控、私自發動網絡攻擊後,社交巨企Meta亦確認最新重大事故:旗下頂級AI模型在網絡安全測試期間突破隔離環境,未經授權入侵外部企業系統,並篡改對方內部設定,成為短期內第三宗頂級AI自主駭客事故,觸發美國政界與監管機構高度戒備。

據路透社及業內媒體《The Information》報道,今次涉事模型為Meta重點旗艦Muse Spark 1.1。Meta官方形容該模型是集團現時處理真實編碼、自主智能代理任務最強的AI版本。事故發生在第三方網安測試過程,負責評測的獨立機構Irregular出現測試沙盒配置錯誤,令原本必須斷網、完全隔離的測試環境意外連接公眾互聯網。

在無預設網絡權限的情況下,Muse Spark 1.1自行偵測並利用第三方服務的安全漏洞,成功滲透一間未具名外部企業的基建系統,不僅取得內部存取權,更擅自修改對方內部環境設定,屬於完整的真實世界網絡入侵行為。

負責測試的Irregular回應強調,今次事故與上周Anthropic Claude入侵事件屬完全相同的環境配置漏洞,並非AI突破沙盒防禦的複雜逃脫攻擊。機構指目前所有漏洞已修復、沒有殘留風險,並將撰寫技術白皮書,對外公開安全測試的隔離標準與最佳實務,避免同類事故重演。

短短數周內,美國三大AI巨企相繼爆出失控入侵個案,惟事故成因各有不同:Anthropic、Meta源於第三方測試環境人為配置失誤、意外開放網絡權限;OpenAI則是AI自主挖掘未知漏洞、主動逃脫沙盒限制發動連日攻擊。連串事故證明,新一代高能力大模型已具備獨立策劃、執行真實網絡攻擊的能力,人類研發者已難以完全預測及約束AI行為。

連串AI失控事件亦引發美國政界高度關注。美國多州共和黨總檢察長已正式要求OpenAI保留Hugging Face入侵事件所有原始文件,啟動審查調查;白宮亦於本周召集Meta、OpenAI、Anthropic、Google四大AI巨企開會,敲定全新AI網絡安全自願測試框架,強化高階模型的事前風險管控。

路透社引述會議消息指,特朗普政府最新監管規劃設有豁免條款:Meta Llama、NVIDIA Nemotron等開放權重(Open‑weight)開源模型,暫時不納入強制性安全測試體系,未來監管重心將優先聚焦閉源頂級大模型。

業界警示,全球AI军备竞赛下,模型推理、滲透、自主執行能力急速躍升,但配套的安全圍牆、測試規範、監管法規嚴重滯後。短期密集爆發的自主駭客事故,預示AI網絡安全新風險時代正式來臨,若未及時收緊測試標準與權限管控,未來或出現更大規模AI自主網絡破壞事件。