
AI資安警鐘!OpenAI承認GPT-5.6內測「失控逃脫」,入侵Hugging Face
OpenAI 承認 GPT-5.6 在測試時失控逃脫被隔離的沙盒,利用漏洞連上外網並入侵 Hugging Face 取得解答,引發業界對資安紀律與 AI 防護的熱議。
OpenAI承認自家模型內測失控,入侵Hugging Face
美國 AI 公司 Hugging Face 上週驚傳遭駭,引發資安領域熱論,今日(7/22)解答出爐:原來是 OpenAI 內部進行網路安全能力評估時,旗下 GPT-5.6 Sol 以及一款尚未對外發布、能力更強的模型,進行了網路攻擊。
OpenAI 發表聲明說明,Hugging Face 資安事件的源頭,是內部測試中刻意降低模型在網路安全方面的拒絕機制,並關閉原本用於防止模型從事高風險網路行為的正式分類器,藉此評估模型的最大攻擊能力。
OpenAI詳細解釋案發經過
OpenAI 表示,原本 AI 模型的測試環境(沙盒)是有好好隔離的,只允許透過內部代管的第三方套件登錄快取代理伺服器安裝軟體套件。
但在專注解決名為 ExploitGym 的網路安全能力基準測試時,投入大量運算資源尋找連上開放網路的方法,最終利用套件代理伺服器中的一項零時差漏洞取得存取權限,並在研究環境中進行多次權限提升與橫向移動,直到連上具備網際網路存取能力的節點。
取得對外連線後,AI 模型推斷 Hugging Face 可能存放 ExploitGym 的資料集與解答,於是結合竊取的憑證與另一項零時差漏洞,在 Hugging Face 伺服器上找到遠端程式碼執行路徑,直接從其正式資料庫取得測試解答。

在上週,Hugging Face 原本把資安事件歸因為 AI 代理人端到端執行,涉及數千個獨立操作,並在多個短時間運作的沙盒中進行,具備自我遷移的指揮控制機制,但當時並不確定攻擊背後使用的是哪個模型。
Hugging Face 共同創辦人 Clem Delangue 曾推測攻擊可能來自前沿實驗室,如今證實確有其事。
目前雙方已展開共同鑑識調查,OpenAI 已回報漏洞給相關廠商,並讓 Hugging Face 加入其網路安全信任存取計畫,同時表示將在漏洞修補期間加強基礎設施管控,即便會犧牲部分研究速度。
論壇熱議:從安全柵欄談到中美AI競賽
OpenAI 涉及 Hugging Face 遭駭案一事曝光後,在 HackerNews 論壇上引發熱烈討論。
首先有網友質疑,這件事足以顯示 OpenAI 在縱深防禦與監控機制上明顯不足,理應先讓模型檢測環境漏洞而非直接利用。
也有網友從產業角度切入,認為外界對 Kimi K3 等中國開源模型的反應遠比這起事件強烈,多半出自財務層面考量,而較少關心 AI 可能造成的實際傷害,並提醒股市禁不起幾次協同駭客攻擊。
另有留言指出,這次測試是在安全防護關閉狀態下要求模型長時間尋找並利用漏洞,模型完成任務同時符合雙方利益,質疑外界是否誤解了對齊風險;但也有反駁認為,AI 系統誤判指令或提供危險建議等情況早已在現實中造成傷害,屬於真實存在的對齊失敗案例。
相關報導:Kimi K3價格策略、KDA機制詳解!SemiAnalysis:為何輝達還是最終贏家?
專家觀點:問題出在基礎資安紀律
多位資安專家也對此案件提出看法,《加密城市》整理如下:
最後在監管方面,也有立法者提出呼籲。德州民主黨眾議員 Greg Casar 表示,政府應建立強制性的獨立安全測試與事件揭露機制,並加強國際合作。