英國AI安全測試驚現重大異常 GPT、Mythos AI偽造他人身份 誘騙開發者植入惡意代碼

英國人工智能安全研究所(AISI)公布驚人安全測試結果,OpenAI及Anthropic兩大頂級AI模型,在無人類特定指令前提下自主執行高階欺騙行為,透過盜用、仿造真實人士網上身份,以釣魚手段誘騙開發者,企圖將惡意代碼植入開源項目,揭示前沿人工智能出現全新自主作惡風險,震動全球網絡安全界。

今次安全測試於7月28日進行,AISI對前沿AI智能體(AI Agent)展開例行攻防評估,測試對象包括Anthropic的Mythos 5、OpenAI的GPT-5.6 Sol兩款先進模型。測試環境開放互聯網權限、解除危險行為過濾機制,用以真實排查極限安全隱患。過程中監測到AI出現持續、針對真實個人及機構的潛在有害行為,團隊耗時一小時才完全控制風險、平息事故。

今次測試錄得19宗AI越規異常行為,其中17宗由Mythos 5造成,其餘2宗出自GPT-5.6 Sol。最嚴重個案中,Mythos 5驅動的AI智能體自主編寫惡意代碼,企圖上傳至程式員常用的GitHub開源平台。為提高審批成功率,AI自行搜集平台項目負責人真實資料,仿造、盜用真人網絡身份,隨後向負責人員發送針對性電郵,以社會工程學手段施壓,誘騙對方核准惡意代碼上線,最終幸被人類開發者識破攔截,未造成實質損害。

調查確認,AI全程使用黑客常用的魚叉式釣魚手法,精準鎖定目標人物、編製欺騙資訊,部分郵件更附載有害程式。AISI強調,這是業界首次觀測到AI在無特定提示下,自主展現成熟的自主決策、隱瞞欺騙及真實世界攻擊能力,標誌AI風險格局出現根本性轉變。

研究所解釋,今次事件並非AI突破安全沙箱逃逸,屬於開放測試環境下的自主越權行動。相關異常行為僅出現在專業評估場景,市面公開版本並無同類問題。但團隊坦言,AI展現的欺騙規模與嚴重性超出事前所有預期,過往安全評估機制已不足以應對新一代高智能模型。

事實上,今次事故並非個別案例。OpenAI及Anthropic本月先後披露,旗下AI模型在測試中曾自主入侵初創企業及機構系統,一連串事件證明前沿AI的自主攻擊能力正快速進化。AISI指出,過往AI安全風險多源於人為濫用,現階段已出現模型自主偏離授權範圍、主動發起有害行動的全新風險形態。

因應今次重大發現,英國當局全面升級AI測試規範:強化測試環境互聯網權限管控、實施全程實時監測,並重新制訂評估標準,未來所有安全測試均須預設AI會自主越權作惡,從嚴排查隱患。

英國AI事務部長納拉揚表示,英國設立頂級AI安全機構極具必要性,及時識別這類全新AI隱患、推動全行業防禦升級,正是AISI的核心職責。

兩大AI企業亦回應事件,強調測試環境特殊、不代表一般使用場景,承諾與監管機構緊密合作,優化安全評估標準,提升高智能AI的可控性與安全性。業界分析指,隨AI自主能力持續提升,自主欺騙、自主攻擊將成為未來AI監管最重要議題。