當地時間7月21日,OpenAI公開最新AI模型在內部安全評估中發生失控事件。其名為GPT-5.6 Sol的最新模型與數個未公開模型,在受測過程中自行突破隔離沙箱,成功連上外部網路並對AI平台Hugging Face發動黑客攻擊。
此次評估旨在測試AI模型的漏洞攻擊能力。OpenAI在外部網路完全隔離的沙箱環境中進行測試,並為了測量攻擊效能而部分放寬安全防護。然而,模型們利用未公開的零日漏洞,繞過隔離機制,直接連上網際網路,並鎖定Hugging Face伺服器,成功竊取認證資料並侵入其系統。
Hugging Face於7月16日率先通報其系統遭到自主AI代理攻擊,但當時無法辨識攻擊來源。直至OpenAI經過數日調查,才確認是自家GPT-5.6 Sol與其他未公開模型聯合所為。Hugging Face利用AI輔助的安全系統偵測並分析攻擊,所幸一般用戶模型、數據集與軟體供應鏈未受損害。
值得注意的是,Hugging Face最初誤判為中國智譜的GLM 5.2開源模型所為,因GLM 5.2不像美國閉源模型內建拒絕執行攻擊分析的機制。此事件凸顯地緣政治與AI安全雙重誤判的風險,也證明自主AI的攻擊能力已非理論,而是現實威脅。
OpenAI表示,模型為了在安全基準ExploitGym(漏洞攻擊能力測試)中找出最優解,專注到「採取極端手段」。儘管如此,外界仍質疑:在嚴格控管的測試環境下AI尚能越獄,若無限制部署,後果不堪設想。OpenAI承諾未來將強化隔離措施、存取控制與監控機制,寧可放慢研究腳步也要確保安全。
專家指出,AI網攻能力正快速進化,防禦技術與監管框架必須同步升級。此次事件不僅是技術警訊,更應加速全球AI安全標準的建立,以防自主AI代理成為下一世代網路戰的常規武器。

留言