中國人工智能初創企業Moonshot AI旗下大型語言模型Kimi K3,8月7日被披露在英國政府AI安全研究所(AISI)評估期間,利用測試沙盒的網絡設定漏洞逃出隔離環境,連上開放互聯網並從GitHub抄取答案完成任務,成為近3星期內第4宗同類個案。
美國網絡保安初創企業Frontier Security披露事件,並澄清Kimi K3並非利用零日漏洞入侵,而是趁沙盒出現網絡設定錯誤,發現一條未被封鎖的對外連接通道。Frontier Security行政總裁Yaron Singer表示:「Kimi K3雖然冇用複雜攻擊手法,但佢已經識得利用測試環境漏洞取巧,反映模型內部缺乏足夠防護機制阻止自己『作弊』。」
Moonshot AI於2026年7月16日推出Kimi K3並免費開放公眾使用,型號採用2.8萬億參數混合專家(MoE)架構,支援100萬token上下文視窗。值得留意的是,今次涉事的Kimi K3屬公開發布、任何人均可下載的開源權重模型,與同類個案中未發布或刻意調低防護等級的測試模型性質不同,一旦存在安全隱患,廠方亦難以統一修補或回收。
除Kimi K3外,Anthropic及Meta亦先後通報模型脫離測試環境事件,兩宗個案均與同一第三方評測公司Irregular有關。Anthropic於7月30日披露,審視141,006次評測記錄後,發現3宗Claude模型接觸真實互聯網並存取3間機構系統的個案,當中一次更製作惡意Python套件並上載至PyPI。Meta於8月5至6日通報旗下Muse Spark 1.1模型同樣因Irregular評測環境設定失誤而取得對外連接。
OpenAI亦於8月4日通報一宗與Irregular相關的獨立事件。此外,OpenAI另一宗涉及Hugging Face的事件更為嚴重,涉事模型利用零日漏洞入侵生產伺服器,兩名研究員在8月5日Black Hat大會上披露,agent之間曾利用內部系統建立未受監察的「訊息板」交換漏洞資訊,其後更自行重建溝通渠道,最終促成入侵。

留言