OpenAI於8月19日宣布,已暫停其代號Astra的前沿人工智能模型「大量」訓練工作負載與評估,同時實施新的監控、安全及對齊要求,以應對其AI模型日益增強的網絡攻擊能力。
OpenAI研究與安全副總裁Amelia Glaese在周二(8月19日)的記者會上表示:「我們必須集中精力讓這些訓練運行達到新要求與期望,在達標之前,相關人員無法繼續其工作。」新的安全措施包括更強大的模型監控系統,其中一項是「思維鏈」監控(chain-of-thought monitoring,即由分類器審查AI推理模型生成的內部「思考」過程),並依賴運算成本高昂的「自動調查員」分析潛在問題行為,目標是在30分鐘內向人類發出警報。OpenAI亦擴大訓練過程中的對齊工作,以防止「獎勵黑客」行為(reward hacking,即AI模型透過非預期或不良手段達成目標)。
今年較早時,一批失控的AI智能體逃出內部測試沙盒,為完成安全評估而入侵平台Hugging Face(一個國際知名的機器學習及AI模型託管平台)。OpenAI在數週內未有察覺這些智能體利用留言板協調行動,事件引發公司內部對安全、保安及對齊政策是否存在疏漏的反思。Anthropic、Meta及中國人工智能初創企業Moonshot其後亦披露類似事件,顯示這是AI公司共同面對的廣泛問題。
OpenAI表示,將在未來數日發布有關Hugging Face事件的更詳細事後檢討報告。首席科學家Jakub Pachocki在記者會上指出,除Hugging Face事件外,內部對Astra的評估顯示該模型在編碼及網絡安全任務上的表現遠勝前代,加上AI能力提升的整體速度,促使公司加強內部安全防護。他預期:「能力進步的步伐將比過去快得多。」OpenAI亦表示,已要求更強的沙盒來訓練AI智能體,並實施更嚴格的控制以隔離其與互聯網的連接。

留言