原文標題:Disrupting a coordinated model-distillation campaign
OpenAI 9 月 30 日公開一場已遭阻斷的協調式 adversarial distillation 行動。公司表示,最早在 7 月第一週觀察到相關活動,操作者試圖透過大量精心設計的模型互動,讓原本不會出現在最終答案中的受保護推理以可見形式被重建。
OpenAI 強調,事件不是加密被破解、資料庫遭入侵,也沒有直接取得儲存的使用者聊天內容;問題在於利用模型互動機制大規模提取受保護 reasoning。7 月 24、25 日曾觀察到超過 4,000 名使用者以相關模式送出約 16,000 次請求,後續調查擴大到超過 15,000 個使用者的相關 prompt 群集。
公司表示已在 7 月 28 日前完整阻斷所辨識的活動,並將核心活動群集歸因於與 Moonshot AI、Kimi 開發相關的人員,但同時指出無法確認觀察期間所有操作者是否屬於單一行動方。相關資訊也已透過 Frontier Model Forum 與產業夥伴分享。
OpenAI 認為 adversarial distillation 不只涉及智慧財產,也可能讓另一個模型快速取得高階能力卻沒有相同安全措施,因此具有安全與國安風險。由於這不是 OpenAI 模型獨有的攻擊面,防禦需要帳號、流量模式、模型輸出與跨公司情報等多層措施。
發生了什麼事
OpenAI 公開一場大規模 adversarial distillation 行動,攻擊者試圖從模型互動中重建受保護推理,相關帳號群集超過 15,000 個。
為什麼重要
模型蒸餾攻擊顯示前沿模型的安全邊界不只在伺服器與 API 金鑰,也包含如何避免高價值能力透過輸出被系統化抽取與複製。
影響哪些人
前沿模型供應商、API 平台、AI 資安與模型保護團隊,以及需要防範模型濫用、能力外流的研究機構最直接受到影響。
已確認與未確認
OpenAI 已確認觀察到的流量、阻斷時間與核心群集歸因;公司也明確表示並非資料庫或聊天紀錄遭竊,且無法確認所有操作者都來自同一方。