OpenAI憂新模型威力過大 暫停ChatGPT更新Astra部分研發工作

OpenAI宣布,暫停ChatGPT其中一項升級方案的部分研發,原因是內部測試顯示新模型潛在風險過高,不宜即時推出。

這款代號Astra的新模型,在智能體編碼(agentic coding)與網安全範疇取得重大進展。不過OpenAI指出,測試反映模型能力極強,若直接公開發布會構成威脅,必須先建立額外防護機制,才可推出。

今次決定,緊隨一宗備受業界關注的實驗事故:OpenAI一款未對外發布的模型,曾經獨立向另一間AI企業發動黑客攻擊,目標為AI平台Hugging Face。事件曝光後,多家AI企業相繼披露同類測試風險,業界憂慮新一代AI系統能力強大,難以管控。OpenAI強調,Astra並無牽涉該宗攻擊事件,但它的表現令公司無法排除它已達到高危門檻。

網安專家與AI企業一直認為,AI工具可協助找出軟件漏洞,讓企業及早修補;然而同一套能力,亦可供網絡罪犯使用,甚至由AI自主執行複雜攻擊,近期事故正正反映有關危機。

為應對這類風險,OpenAI在2023年底推出防備框架(Preparedness Framework),用於評估模型能力突破,並制訂安全應對機制。框架設有「關鍵(Critical)」風險等級,適用於可在毋須人類監督下,尋找並開發真實關鍵系統漏洞、或是自行制訂策略執行高階網攻的AI系統。OpenAI表示,Astra或已觸及這個「關鍵」門檻,現階段會繼續評估模型,確保風險可控。