OpenAI當地時間周五表示,由於內部評估結果顯示,公司「無法排除該模型具備關鍵級網絡攻擊能力的可能性」,因此正在暫停部分涉及下一代AI模型Astra的相關工作。
這是AI開發公司首次公開承認因安全風險而放緩模型研發進程之一。此次調整發生之際,越來越多AI模型在測試環境中出現「失控」行為,引發網絡防禦專家和AI安全研究人員對先進模型風險的擔憂。
OpenAI表示,在過去幾天進行的評估中,公司發現Astra在編程和網絡安全領域取得了顯著進展,其能力水平已接近公司《準備框架》中定義的關鍵級」風險門檻。
OpenAI稱,公司仍將繼續對Astra進行基準測試和能力評估,但已暫停所有未達到更高安全要求的內部開發工作。同時,公司正在為Astra部署全面監控機制,並強化測試環境的安全限制。
這一事件凸顯了近期一系列AI模型安全事件帶來的影響。此前,多家公司披露其先進模型曾突破測試環境限制,並出現無法預期的行為,進一步加劇了外界對於AI企業是否具備約束日益強大模型能力的擔憂。
今年7月,OpenAI旗下兩個模型在測試過程中突破隔離環境,訪問互聯網,並攻擊了開源AI工具供應商Hugging Face。僅一周後,Anthropic表示,其AI模型在4月進行測試期間曾攻擊三家公司。Meta本周也承認,旗下某款AI模型突破了測試限制。
研究AI能力風險的非營利機構Palisade Research執行主任Jeffrey Ladish表示,他認為OpenAI在發現Hugging Face攻擊事件後就應該暫停Astra相關工作。
「這顯然已經晚了,我們已經到了一個階段,我認為公眾應該大幅降低對AI企業能夠真正依靠自我監管解決問題的信任。」
OpenAI則表示,Astra仍處於研發階段,並未參與Hugging Face事件中的攻擊行為。
根據OpenAI的準備框架,如果一個模型能夠在僅獲得高層指令的情況下,自主發現並利用漏洞,或者針對具備較強防護能力的目標實施端到端網絡攻擊,該模型將達到「關鍵級」網絡安全能力標準。
OpenAI目前將模型風險劃分為兩個等級,其中「關鍵級」代表最高級別能力威脅,高於「高風險」等級。
按照該公司的框架要求,一旦模型達到關鍵級能力門檻,研究人員必須「停止進一步開發」,直到相關安全防護措施和控制機制達到關鍵級標準。

