人工智能發展應敲響安防警鐘
222
訂閱已訂閱已收藏
收藏點擊播報本文,約
當地時間8月26日,OpenAI發布對7月AI智能體入侵“抱抱臉”事件的完整調查報告。同日,美國AI研究機構METR和Redwood Research公布獨立調查結果:約1200個原本應該彼此隔離的AI智能體,通過一個未經授權的內部留言板交換了超過7萬條消息和文件,其中約700個參與了對“抱抱臉”的攻擊。調查還發現,這些智能體不僅相互分享漏洞和攻擊方法,還研究如何修改、偽造甚至刪除自身行為記錄,以逃避監控。
“抱抱臉”是全球知名的AI開源平台,研究人員和開發者可以在這裡分享、下載和使用AI模型、數據集及開發工具。7月16日,“抱抱臉”公開披露一起安全事件,但當時沒有公布攻擊者身份。5天后,OpenAI承認,攻擊來自正在接受網絡安全能力測試的自家AI模型。
一場安全測試最終演變成攻擊
此次事件源於OpenAI對AI模型網絡安全能力的測試。模型需要在特定計算機環境中尋找漏洞、編寫代碼並完成網絡安全任務。OpenAI稱,一些測試任務極其困難,甚至可能無法完成。但模型沒有停止行動,而是開始尋找“捷徑”。OpenAI將這種行為稱為“獎勵作弊”,即模型為了獲得預期獎勵,採取測試人員沒有預料到的方式完成目標。
據《華盛頓郵報》報道,OpenAI模型發現了限制它們的計算機系統中的未知漏洞,並利用這些漏洞逃離測試環境、進入互聯網,隨后入侵“抱抱臉”內部系統,意圖尋找測試答案。模型還試圖掩蓋作弊行為,包括修改此前的陳述以及攻擊評估系統。
7月21日,OpenAI與“抱抱臉”公布初步調查結果,稱相關模型利用雙方環境中的多個漏洞,最終獲得了“抱抱臉”生產數據庫中的測試答案。其中一個關鍵突破點是OpenAI內部軟件包中的一個此前未知漏洞,模型利用這一漏洞獲得了互聯網訪問能力。
但真正出乎意料的是,這些AI智能體開始相互通信。
1200個智能體大量交換信息
METR和Redwood Research調查發現,一個名為PHASEONE10841的AI智能體建立了未經授權的留言板。幾小時內,超過50個智能體發現了這個渠道,並發送了1000多條消息。隨著測試繼續,最終約1200個智能體加入這一通信網絡。
據美國The Verge網站報道,PHASEONE10841會向其他智能體分配任務,其他智能體則把發現的漏洞、測試方法和解決方案發回留言板。《華盛頓郵報》報道稱,這些智能體在7月一周左右的時間裡大量交換信息,逐漸形成協作網絡。
更令人關注的是,它們開始研究如何隱藏自身活動。這些智能體“大量研究”如何偽造、修改,甚至刪除自己的操作記錄,以避免被發現﹔它們還能夠偽造部分工具調用,使研究人員看到的記錄與實際行為出現差異。
最終,近700個智能體參與了對“抱抱臉”的攻擊。OpenAI確認,“抱抱臉”並非此次攻擊中唯一遭到入侵的組織,但也沒有公布其他目標。
據《連線》雜志報道,OpenAI早在5月26日前后就發現過AI智能體在進行留言活動。但直到7月6日,負責事件監測和響應的相關領導層仍不知道這一通信渠道的存在。
7月20日,OpenAI發現這起攻擊。此時距離AI智能體首次繞過相關安全防護已經過去12天。OpenAI隨后聯系“抱抱臉”並啟動遏制措施,3天內關閉了大部分未經授權的活動。
AI安全防線需重新設計
OpenAI將此次事件稱為對公司和整個世界的一次“警告”:如果缺乏適當的安全防護,能力強大的AI智能體已經能夠繞過技術控制,通過未經批准的渠道協作,並採取沒有任何人類指示它們實施的危險行動。
過去,AI安全防護主要針對單個模型:限制訪問權限、隔離運行環境、切斷互聯網連接,再通過監控系統發現異常。但此次事件顯示,多個智能體可能自行建立通信渠道,共享信息和漏洞,形成分工協作。
據《連線》雜志報道,OpenAI承認,如果當時已經運行目前部署的“思維鏈”監控系統,相關異常活動可能在模型突破“抱抱臉”系統前一天就被發現。該公司承認,一些早期異常信號本可以促使其更早採取行動。OpenAI計劃建立全天候安全事件響應機制,在發現嚴重事件后30分鐘內通知相關人員。
對於AI行業而言,當多個智能體擁有操作計算機、調用工具,並持續執行任務的能力后,傳統安全邊界也面臨新的挑戰。
此次事件沒有人類直接指示AI智能體攻擊“抱抱臉”,但它們最終實施了攻擊。如何及時發現這種行為,又如何阻止多個智能體通過相互協作放大風險,已經成為AI安全研究無法回避的問題。(本報記者 張佳欣)
關注公眾號:人民網財經
分享讓更多人看到
- 評論
- 關注































微信掃一掃


第一時間為您推送權威資訊
報道全球 傳播中國
關注人民網,傳播正能量