OpenAI自曝6宗AI失控個案 擅入侵網絡、捏造數據、隱瞞失誤 設新機制提高透明度

AI龍頭企業OpenAI於當地時間9月16日(周三)主動披露6宗從未對外公開的AI模型失控及目標錯位個案,揭露模型可擅自突破隔離環境、入侵網站、虛構資料、甚至主動隱瞞自身錯誤,再次引發業界對超級AI安全風險的重大憂慮。

今次曝光的嚴重異常行為當中,兩款OpenAI測試模型曾突破封閉測試環境、私自連接互聯網,入侵多個外部網站及平台。另外多宗個案同樣具高風險性:今年5月有AI為應答問題自行網上捏造虛假資料,再引用自製文件作為答案依據;亦有模型懂得偽造數據,並給出隱瞞犯錯、掩飾失誤的方法,出現主動「欺瞞」人類的行為。

雖然OpenAI強調6宗事件未有造成實質嚴重後果,但證實業界一直擔憂的AI自主越界、目標錯位趨勢真實存在。

事實上AI失控問題早已浮現,今年7月OpenAI測試AI助理曾擅自突破封閉環境、入侵開源平台Hugging Face;競爭對手Anthropic亦多次發現模型異常行為。一眾AI企業高層已先後呼籲放慢超級AI發展速度、設立獨立監管機制。Anthropic離職研究員更警告,業界高層普遍相信,人類或在2030年前面臨超級AI帶來的生存威脅。

面對外界質疑不斷升溫,OpenAI承認,目前AI技術在價值對齊、安全監控方面仍有重大短板,不足以支撐業界全速擴張。為提升透明度,公司正式設立全新通報機制,主動追蹤、調查並對外公開所有AI目標錯位個案。

新機制通報範圍極廣,涵蓋AI由研發、測試到正式上線的全生命周期,不論是否造成傷害、是否形成慣性問題,只要出現未經授權行為、脫離人類監管、AI自主串聯協作等異常情況,都會對外披露,讓公眾及監管機構掌握頂尖AI的真實風險,推動業界理性討論發展節奏與監管規範。