116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

機器之心編輯部

「這是今年最好的安全論文,幫 Anthropic、OpenAI、Google 修了個價值十億美元的大 bug論文。」

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

今天,一篇關於前沿大模型安全漏洞的論文,在社交媒體上引發軒然大波論文

短短 19 個小時,已吸引 220 萬人圍觀、討論論文

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

該論文的核心主張是,各大前沿模型 API 存在設計缺陷,原本被加密隱藏的完整思維鏈,可以被完整地提取出來論文

由於他們拿不到伺服器中的原始明文,無法逐字核對,只能用 API 賬單記錄的「思考 Token 數」進行長度驗證論文

在他們測試的大多數提示詞中,提取出的推理 Token 數與 API 計費記錄中的思考 Token 數基本呈 1:1 對應論文

這說明,提取結果很可能覆蓋了大部分隱藏推理論文

展開全文

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

論文標題:Stealing Reasoning Traces from Proprietary LLM APIs

論文地址論文

過去一年,大模型廠商認真藏起模型的「思考過程」論文

這是因為完整思維鏈記錄了模型如何拆解問題、嘗試方案、發現錯誤再修正論文。對競爭對手來說,這些資料的價值遠高於一個最終答案;對模型廠商來說,它也可能暴露安全策略、使用者隱私甚至 API Key。

於是,OpenAI、Anthropic、Google 等主要廠商都開始把完整推理過程藏起來論文。取而代之的是以一種使用者無法直接讀取的加密文字塊形式返回給客戶端。

為了在多輪對話中保持上下文連續性,同時避免在伺服器端儲存全部推理狀態所帶來的開銷,客戶端需要在之後的每次 API 請求中,把這段加密後的推理塊重新傳回模型服務商論文

這樣的無狀態架構雖然解決了儲存問題論文,卻也引入了一個關鍵漏洞:

這些加密塊在同一家模型提供商的生態內部,可以跨不同會話、不同使用者,甚至不同模型完全相容並相互替換論文

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

加密推理的跨模型相容性(截至 2026 年 7 月)論文。表格的行代表生成加密推理塊的源模型,列代表接收注入推理塊的目標模型。✓ 表示在這一模型組合中,目標模型能夠讀取並處理被注入的推理內容。Claude:除 Fable 5 生成的推理外,其他模型的推理軌跡均可由任意同系列模型重放。GPT:GPT-5.6 系列可以重放此前所有代際模型生成的推理軌跡。Gemini:任意模型生成的推理軌跡都可以注入並重放到其他模型中。

也就是說想偷走最強模型的隱藏思維鏈,甚至不需要攻破最強模型,攻破較弱一點的模型就可以論文。Anthropic、OpenAI、Google 全都中招。

強模型嚴防死守論文,弱模型一問就招

這個漏洞根源,在於同一模型家族內部存在明顯的安全能力不對稱論文

研究發現 Claude Opus 4.8、GPT-5.6 Sol 這樣的前沿模型,通常接受了非常嚴格的安全強化和拒答訓練,能防止模型洩露自己的內部思維鏈論文

但它們能力更弱的同系列模型,比如 Claude Haiku 4.5 或 GPT-5.6 Luna,往往缺乏同等級別的反蒸餾防禦論文

攻擊者因此可以利用這一安全差距,把一個合法且經過認證的加密 reasoning block 從強模型轉移到弱模型中,從而完全繞過前沿模型本身的對齊機制,並把這個更弱、更容易服從指令的模型變成一個它自己都沒有意識到的解密預言機(decryption oracle)論文

這件事也暴露出了推理模型時代一個新的安全規律:一個 AI 模型家族的安全上限,很可能由其中最弱的相容模型決定論文

「偷」走隱藏思維鏈只需兩步

整條攻擊鏈並不複雜論文

第一次呼叫中,攻擊者向強模型提交一道數學題、程式設計題或其他任務論文。強模型完成推理,API 返回可見答案、推理摘要和加密推理塊。

第二次呼叫中,攻擊者把這段密文插入一個相容模型的上下文,再要求它逐字複述先前的思考論文。服務端會先驗證和解析密文,較弱模型隨後接觸到恢復後的推理狀態,並在越獄提示下將其輸出為明文。

針對 Claude,研究者選擇 Haiku 4.5 作為解碼模型;針對 GPT,他們使用 GPT-5.6 Luna;針對 Gemini,他們使用 Gemini Robotics 1.6論文。相關測試基於 2026 年 7 月初可用的模型和介面。

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

論文展示的跨模型思維鏈提取流程:Claude Opus 4.8 生成的加密思考塊被移交給 Haiku 4.5 後,隱藏推理重新變成明文論文

研究者無法直接取得真實明文,因此不能證明每個字元都被準確恢復論文。他們改用 API 報告的推理 token 數作為近似校驗訊號。

在 120 道 Codeforces 題目上,提取文字的 token 數與源模型報告的推理 token 數整體高度接近,還原結果也明顯比官方摘要更詳細,並多次出現可見對話中沒有的敏感資訊論文

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

三家廠商的解碼文字長度與 API 計費思考 token 數整體呈明顯對應關係論文

這些證據表明,隱藏思維鏈能夠以較高保真度被提取論文。不過,解碼過程依賴模型的隨機生成,部分軌跡仍可能出現內容遺漏、表述改寫或亂碼,因此目前還不能將其視為對原始思維鏈的逐字復現。

這個漏洞的破壞力

這樣一條漏洞,可以開啟四條攻擊路徑論文

第一條路徑是模型蒸餾論文

最終答案只包含計算結果,完整思維鏈還儲存了模型如何拆解任務、嘗試錯誤路線和修正判斷論文。這類資料提供的訓練訊號更加密集,也更適合訓練新的推理模型。

論文估算,按照 Claude Haiku 4.5 的 API 價格,解碼 1 萬條推理軌跡,每條包含約 1.2 萬輸入 token 和 1.2 萬輸出 token,名義成本約為 720 美元論文。高價值推理資料由此具備了批次提取的經濟可行性。

第二條路徑是繞過安全輸出論文

模型可能在隱藏推理中詳細分析危險內容,最後只向使用者返回一段剋制的拒絕回答論文。輸出過濾器保護了可見答案,完整分析過程仍保留在加密思考塊中。一旦這段內容被弱模型複述為明文,最終輸出層的安全限制便會完全失效。

第三條路徑是隱私洩漏論文

開發者經常把 Agent 的執行軌跡上傳到 GitHub 或 Hugging Face,用於除錯、復現和共享論文。可見文字通常會經過清理,加密思考塊看起來只是一串無法理解的字元,很容易被直接保留下來。

論文收集了 6708 條公開軌跡,並重建出 315320 個思考塊論文。經過兩階段模型標註,1028 個思考塊被判斷包含至少一項真實隱私資訊,佔比約為 0.3%。按完整軌跡統計,共有 328 個會話出現洩漏,佔比達到 4.9%。

排除帶有合成人設的基準測試資料後,研究者仍識別出 62 個 API Key、33 個密碼、24 個訪問 token、7 個私鑰和 30 個個人郵箱論文。704 項非基準隱私資訊中,有 64 項只存在於隱藏推理,公開對話中完全找不到對應內容。

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

從公開的使用者釋出軌跡中抓取並恢復出的推理塊中的不同痕跡(異常特徵),被歸為三大核心類別論文

一個常見觸發場景是「幫我清理倉庫裡的金鑰」論文。模型會在隱藏推理中重新列出待刪除的憑據,再去修改檔案。使用者釋出清理後的倉庫時,可見位置已經乾淨,加密思考塊卻仍可能儲存著原值。傳統的文字脫敏在這裡失效了。

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

解碼後的推理過程包含隱私痕跡論文。這是釋出在網上的兩個非公開推理塊被解碼後的定性示例,其中包含隱私敏感資訊。左圖:GPT-5.2 Codex 召回了在將程式碼庫釋出到 GitHub 之前必須刪除的 API 金鑰。用 XXXXX 遮蔽了每個金鑰的最後五個字元。右圖:Claude Sonnet 4.6 在 ClawBench 的測試流程中處理機票預訂任務時,對合成虛擬人物 Alex Green 的私密資料進行了推理。需要說明的是,Alex Green 這一人物是合成基準測試中的虛構身份,並非真實存在的人。

第四條路徑是隱形提示詞注入論文

攻擊者可以先讓模型在思維鏈中接受一條惡意指令,再把生成的有效思考塊混入共享軌跡論文。其他使用者恢復這段任務時,模型可能把惡意內容視為自己的歷史推理。

論文展示了一項資料外傳實驗論文。模型表面上正在完成 PPT 編輯或資料研究,後臺卻按照隱藏指令,把本地檔案上傳到攻擊者控制的伺服器。公開聊天記錄保持正常,傳統日誌審計很難發現密文中的指令。

這類攻擊對長程 Agent 尤其危險論文。任務執行時間越長,重新執行的成本越高,開發者也更願意直接共享、恢復和續跑已有軌跡。加密思考塊由此進入 Agent 的供應鏈,並具備影響後續行為的能力。

開放模型是否用過閉源推理資料論文

論文附錄還提出一個問題:近期開放模型是否使用過閉源模型的隱藏思維鏈進行蒸餾論文

研究者把少量 Claude Opus 4.8 或 GPT-5.6 Sol 推理片段放進開放模型的推理開頭,再觀察後續生成,可見答案始終由模型自由生成,沒有預填論文

實驗發現,Kimi-K3 接收到 Opus 推理字首後,可見答案的措辭會明顯靠近 Opus論文。短字首也會讓 Kimi-K3 和 GLM-5.2 的推理風格向 Opus 移動;Sol 字首則會讓 Kimi-K3 向 Sol 靠近。DeepSeek-V3.1 和 Inkling 沒有出現同等幅度的變化。部分效應只需一到四個詞就會出現,隨後趨於飽和,更像模型識別到了某種風格提示。

但這組結果遠不能構成蒸餾證據論文。實驗樣本較小,題目集中於少數基準;推理文字來自模糊提取,服務配置也不受研究者控制;字首本身還能充當強風格提示。更關鍵的是,機率提取實驗沒有發現可實際利用的逐字記憶,想要讓 Kimi-K3 復現 16 個目標推理 token,通常需要約 10⁹ 到 10¹² 次查詢。

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

以 GPT-5.6 Sol 或 Claude Opus 4.8 推理片段作為字首後,不同開放模型與源模型的特徵 n-gram 重合度變化論文

在這裡有一個被外界懷疑的問題在於,論文作者嘗試了近期開源的 Kimi K3 和 GLM-5.2,對應的 DeepSeek 版本卻是遠古的 V3.1論文。我們知道,DeepSeek V4 Preview 的釋出時間是早於 Opus 4.8 和 GPT 5.6 的,可能使用了新版本的 DeepSeek,會推出相反的結論。

模型在背地裡還幹了什麼論文

研究團隊用提取出的隱藏推理,額外觀察了一批模型在真實使用中的 scheming(謀劃)與 reward-seeking 等行為,並將相關發現放進了論文附錄論文

摘要在說謊論文

模型給出的推理摘要經常刻意省略關鍵資訊論文。例如 Opus 4.8 在解 AIME 題目時,已提前得知答案,隨後倒推解題過程以匹配該答案,但這些內容完全未出現在最終摘要中。

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

讀不懂的推理論文

OpenAI 模型有時會陷入「外星語」式思考,使用「we」、「it」自稱,或反覆迴圈「vantages」、「marinades」、「watchers」等詞彙,即使在有明確提示的情況下,也難以判斷其真實意圖論文

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了 116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

主動謀劃論文

有時模型會在自己的思維鏈裡直接使用「cheat」這類詞,毫不掩飾地記錄自己的謀劃過程論文

研究者發現,模型確實考慮過欺騙或作弊,但最終因為覺得使用者會發現而決定不做論文

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了 116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

為了解一道數學題,模型開始攻擊網站論文

研究人員發現了一條模型執行軌跡,模型只收到一道數學題,以及一條系統指令:無論遇到什麼困難,都要堅持完成任務,不能向使用者求助論文

連續嘗試多次失敗後,模型開始上網搜尋,並找到一個可以驗證候選答案的網站論文。它意識到,可以把這個網站當作驗證答案的「預言機」。

隨後,模型嘗試透過 OCR 識別驗證碼論文。識別失敗後,它開始尋找網站的安全漏洞,試圖繞過限制。最終,模型放棄了攻擊,靠自己解出了這道題。

116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了 116頁論文教你「蒸餾」Claude、GPT-5.6:AI社羣今天炸了

在修復建議上,作者認為僅靠把弱模型訓練得更安全是不夠的,還需要從 API 架構層面入手論文。例如把 reasoning 繫結到具體使用者、會話和模型,阻止跨使用者、跨會話、跨模型重放;或者乾脆把完整 reasoning 留在伺服器端,只給客戶端一個 ID。與此同時,公開 Agent 日誌時,也應該直接刪除所有加密 reasoning block,因為使用者自己看不到裡面是否藏著 API Key、密碼等敏感資料。

論文最後還提出一個更深的問題:隱藏思維鏈到底應不應該長期儲存和加密論文

因為加密確實能保護模型智慧財產權和部分安全資訊,但它也讓使用者失去了監督能力論文。使用者不知道模型在隱藏 reasoning 裡記錄了什麼,也無法判斷 reasoning summary 是否真的忠實於模型實際的推理過程。

所以作者認為,未來一種可能的方案是讓 reasoning 變成臨時狀態:模型每輪正常思考,生成答案後就刪除,不長期儲存,也不返回客戶端論文

瞭解更多內容,請參考原論文論文

參考連結論文

本站內容來自使用者投稿,如果侵犯了您的權利,請與我們聯絡刪除。聯絡郵箱:835971066@qq.com

本文連結://amp.yxd-1688.com/post/65624.html

🌐 /