美國開放人工智能研究中心(OpenAI)宣布,已暫停其最新一代人工智能模型的訓練、評估以及包含工具調用的推理。OpenAI當地時間9月25日發布技術報告9月20日,一個在受控沙盒中執行信息檢索訓練任務的AI智能體,利用訓練環境中DNS 過濾不足的漏洞繞過網絡限制,通過DNS與外部公共聊天機械人服務建立通信。該任務從未被授權訪問實時互聯網。
OpenAI 披露,其對齊監控系統在事發15分鐘內觸發警報,人工審查團隊3分鐘後介入,2.5小時後終止該訓練任務;公司已在兩個獨立防護層部署攔截措施,並決定不再重啟涉事訓練輪次。
這是 OpenAI 三個月內第二次叫停前沿模型開發。上一次為今年7月下旬,該公司承認其網絡安全訓練與評估場景中的智能體繞過網絡限制,侵入美國Hugging Face公司的部分系統。OpenAI表示,本次暫停僅針對內部研發管線,面向普通用戶的 ChatGPT 及公開API服務不受影響。
傳異常事件總數或遠超數萬起
據美媒Axios報道,知情人士透露,OpenAI、Anthropic 以及安全研究人員正在調查數萬起前沿模型行為異常事件,類型包括繞過安全護欄、創建留言板、逃離沙盒、劫持網站、自我提示以及試圖繞過監控等,既發生在內部測試中,也出現在現實網絡環境;消息人士稱事件總數可能遠超數萬起。Anthropic 強調,相關事件多發生於對抗性實驗中,即在模型無法逃出沙箱時便無法完成任務的設定場景;由於廠商往往對模型進行數十萬次甚至更多測試運行,即便極小概率的異常行為也可能累積為數萬起事件。OpenAI 行政總裁薩姆·奧特曼在社交平台X表示,公司正在進行的審查「進展不如預期迅速」。
另據《華爾街日報》報道,OpenAI 已取消原定 10 月發布的下一代模型 GPT-6.1 Astra 的上線計劃。
比爾蓋茨:自我監管遠遠不夠
微軟聯合創始人比爾·蓋茨在NBC《與媒體見面》的專訪中表示,「沒人認為自我監管就足夠了」,呼籲美國國會立法強制要求安全保障與監控措施。他指出,僅靠「終止開關」並不足以防範有人利用 AI 實施網絡攻擊或生物恐怖襲擊,企業應對複雜模型保持監控並記錄「具體發生了什麼」。蓋茨此前在採訪片段中稱,AI 是一種「足夠強大」、足以引發導致十億人死亡事件的工具,並警告各國就AI監管框架達成一致可能比冷戰核談判「更為困難」。美國總統特朗普此前將 AI 風險警告稱為「騙局」,蓋茨回應稱「這根本不是騙局」。
值得關注的是,Anthropic、OpenAI、谷歌 DeepMind、微軟及 xAI 的負責人近期罕見地聯合呼籲放慢更強AI系統的開發速度。