OpenAI模型失控,中國開源模型“救場”
222
訂閱已訂閱已收藏
收藏點擊播報本文,約
7月22日,人工智能研究公司OpenAI確認,上周AI平台Hugging Face(抱抱臉)遭遇“史上首例AI自主入侵事件”,攻擊者是其自家模型GPT-5.6 Sol。
AI大模型為什麼會自主驅動網絡入侵?網絡安全失控了嗎?科技日報記者就此採訪了有關專家。
第一問:AI大模型為什麼會自主攻擊網絡?
“從Hugging Face這事來看,AI模型搞起事情來真是目標堅定、能力超強、路子夠野。”奇安信人工智能公司安全專家汪列軍感慨。
事件起因是OpenAI內部一個名為“ExploitGym”的網絡安全評估測試。為了測量模型的真實攻擊能力,研究人員刻意關閉安全護欄,並將模型置於一個與互聯網隔離的“沙盒”環境中。然而,這個被寄予厚望的AI模型不甘心被“關在籠子裡”。它花費大量推理算力,最終找到測試環境中一個此前無人發現的零日漏洞,成功突破隔離,獲得互聯網訪問權限。
拿到網絡權限后,模型開始在OpenAI的研究環境裡提權、橫向移動,並推斷出Hugging Face上可能存有測試答案。於是,它將竊取的憑証和零日漏洞串聯起來,找到一條遠程代碼執行的路徑,直接攻破Hugging Face的生產服務器,用汪列軍的話說,“完成一次教科書式的自主網絡攻擊”。
“‘失控’的本質,還是因為模型的能力邊界已經超出了人類為它預設的安全約束邊界。”賽迪研究院信息化與軟件產業研究所副主任黃文鴻表示,模型沒有越權的“主觀意識”,但它有越權的“能力”和“動機”,動機來自任務目標本身。這是最令人警醒的地方,AI本身是沒有道德感和分辨對錯能力的,它也不是一個有“惡意的AI”,但因為足夠聰明、又被賦予了足夠工具權限的AI,因此做了“並不正確的事”。
第二問:為何AI安全過濾器拒絕分析請求?
戲劇性的是,當Hugging Face的工程師們試圖用商業AI模型分析這次攻擊的載荷時,AI的安全過濾器卻拒絕了請求。汪列軍認為,這揭示了一種可能:用AI攻擊,用AI防御,但防御方的AI卻因為“過度謹慎”而臨陣脫逃。
最終,他們也不得不求助於來自中國的開源模型,通過在本地基礎設施部署GLM-5.2,才完成整個取証分析流程。
“這確實說明,粗顆粒度的安全防護機制在關鍵時刻可能適得其反。”黃文鴻說,“真正需要解決的是安全機制的精細化和上下文感知能力,能區分對抗場景和正常使用場景,能識別請求者的身份和意圖,而不是對所有涉及敏感內容的請求一刀切地拒絕。”
同時,Hugging Face最終轉向智譜的開源模型GLM-5.2在本地完成取証,恰恰說明,對安全團隊而言,擁有一個可以在自己基礎設施上運行、不受外部使用策略約束的強能力模型,已經是應急能力建設的剛需。
第三問:傳統網絡安全防御體系是否正在失效?
“這起事件的意義已超出單一安全事故的范疇。”黃文鴻表示,傳統網絡安全防御的底層假設基於攻擊者是人,攻擊速度受人類認知和操作能力限制,攻擊行為有可識別的人類特征模式。
而該事件打破了這三個前提。GPT-5.6 Sol在一個周末內執行了超過17000次自動化操作,從發現零日漏洞到完成多集群滲透,全過程無人干預。它不疲勞、不犯低級錯誤、不留下人類攻擊者慣有的行為指紋。
“在AI自主攻擊的時代,攻擊速度和復雜度已遠超人類分析師的響應極限。”汪列軍說,“我們必須轉變思路,從被動地‘追著漏洞跑’轉向主動防護,構建一個即使存在漏洞,也能有效抵御攻擊、限制損失並快速恢復的彈性系統。”
AI智能體可以全天候並行試探、快速更換路徑、自動串聯漏洞,並用數萬次低成本操作壓縮攻擊周期。“下一步安全體系建設的方向很明確。”黃文鴻建議,必須用AI對抗AI,要加入機器速度的行為檢測、全軌跡監控、自動隔離和熔斷、彈性恢復,並把每個智能體視為受限權限的潛在內部威脅。(本報記者 崔 爽)
關注公眾號:人民網財經
分享讓更多人看到
- 評論
- 關注































微信掃一掃


第一時間為您推送權威資訊
報道全球 傳播中國
關注人民網,傳播正能量