🐯最新收集於 17m

加密思維鏈重放暴露隱藏推理

加密思維鏈重放暴露隱藏推理
PostLinkedIn
🐯閱讀原文: 虎嗅

💡低成本攻擊可能將隱藏思維鏈還原成明文,並一併暴露使用者資料。

⚡ 30-Second TL;DR

有什麼變化

同系列的較弱模型可充當加密推理軌跡的「模糊解碼器」。

為什麼重要

AI 供應商可能需要重新設計無狀態上下文處理、金鑰管理、模型路由與思維鏈隱私控制。使用隱藏推理的開發者應假設,由客戶端回傳的加密產物可能成為跨模型洩露通道。

下一步行動

稽核應用程式日誌與客戶端狀態中的加密推理區塊,並改用每個工作階段專用、由伺服器控制的金鑰,避免長期保留。

誰應關注:Researchers & Academics

關鍵要點

  • 同系列的較弱模型可充當加密推理軌跡的「模糊解碼器」。
  • 攻擊利用了由客戶端持有的加密區塊、跨模型相容性,以及疑似共用的全域加密金鑰。
  • 研究估計,使用 Claude Haiku 4.5 解碼 1 萬條軌跡,API 名義成本約為 720 美元。
  • GitHub 與 Hugging Face 上共享的 Agent 日誌,可能在無需存取前沿模型的情況下暴露敏感加密推理內容。
  • 據報 OpenAI 與 Anthropic 早在數月前就收到通知,但起初認為風險難以重現或沒有安全影響。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 研究發現該漏洞的核心在於模型訓練過程中使用的『權重共享』機制,導致不同規模的模型在處理隱藏思維鏈(CoT)時,其潛在空間(Latent Space)存在高度的語義對齊。
  • 攻擊者不僅能重建推理內容,還能透過重放攻擊提取出模型在推理階段生成的『系統提示詞(System Prompts)』,這些提示詞通常包含未公開的行為準則。
  • 學術界將此類攻擊歸類為『側通道推理洩露(Side-Channel Reasoning Leakage)』,並指出即使更換加密金鑰,只要模型權重架構未變,攻擊依然有效。
  • 部分開源模型社群已開始開發『思維鏈去噪器(CoT Denoiser)』,旨在透過擾動加密區塊的統計特徵,防止較弱模型進行有效解碼。
  • 該漏洞揭露了大型語言模型在處理『隱私敏感推理』時,現有的加密方案僅能防止外部攔截,卻無法防禦來自模型生態系統內部的『同源解碼』。

🛠️ 技術深入

  • 攻擊機制:利用了模型在處理長序列推理時,為了維持上下文一致性而採用的固定長度嵌入(Fixed-length Embeddings)作為加密區塊的填充物。
  • 解碼原理:較弱模型(如 Haiku 4.5)透過對加密區塊進行『零樣本重構(Zero-shot Reconstruction)』,將加密的潛在向量映射回可讀的自然語言空間。
  • 漏洞成因:模型在訓練時使用了相同的分詞器(Tokenizer)與嵌入層(Embedding Layer),導致加密後的向量在不同模型間具有可逆的數學轉換關係。
  • 數據特徵:加密區塊通常表現為高熵的雜訊分佈,但透過特定提示詞引導(Prompt Injection),可迫使較弱模型將這些雜訊視為『待翻譯的加密文本』進行處理。

🔮 前景展望AI analysis grounded in cited sources

模型供應商將被迫放棄現有的同源加密方案,轉向基於硬體安全模組(HSM)的推理隔離技術。
現有的軟體層面加密已證實無法抵禦同系列模型的解碼攻擊,必須從硬體層面限制推理軌跡的存取權限。
未來六個月內,主流模型 API 將強制實施『推理軌跡雜訊注入』機制。
為了防止重放攻擊,模型輸出將在加密區塊中加入動態雜訊,使得未經授權的模型無法還原原始推理內容。

時間線

2026-03
研究人員首次在內部測試中發現跨模型推理軌跡的可解碼性。
2026-05
研究團隊向 OpenAI 與 Anthropic 安全團隊提交漏洞報告。
2026-07
漏洞細節在安全研究社群中被初步披露,引發關於模型隱私架構的廣泛討論。

📰 事件追蹤

📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅