
加密思維鏈重放暴露隱藏推理
研究人員證明,前沿模型的加密思維鏈區塊可被重放至較弱模型,並以明文重建。此漏洞可能以低成本促成模型蒸餾、隱私洩露、有害內容曝光與提示注入發現。
Tag: #model-security12 results

研究人員證明,前沿模型的加密思維鏈區塊可被重放至較弱模型,並以明文重建。此漏洞可能以低成本促成模型蒸餾、隱私洩露、有害內容曝光與提示注入發現。

一項新的研究方法透過將微調限制在由受信任的 LoRA 適配器定義的子空間內,來防止模型中毒。這使得惡意行為在幾何上變得無法達成,同時保持模型學習合法任務的能力。
Anthropic 正與川普政府進行深入談判,旨在解除對其頂級 AI 模型的現有限制。雙方討論的重點在於解決這些高效能系統所引發的安全疑慮。

White Circle 獲 OpenAI、Anthropic、DeepMind、Hugging Face、Mistral、Datadog 和 Sentry 高管支持的 1100 萬美元種子輪融資。此平台用於生產環境中監控、安全與控制 AI 模型,已處理逾 10 億 API 請求。客戶包括 Lovable 和全球兩大數位銀行。
美國財政部技術團隊正尋求存取 Anthropic PBC 的 Mythos AI 模型。目的是在模型中搜尋漏洞與缺陷。此資訊來自一位熟悉情況人士。

新興的「毒化 AI」運動試圖透過污染訓練資料,破壞 ChatGPT 與 Gemini 等模型。雖然目標是大型科技公司,但遭毒化的資料也可能危害一般使用者與小型組織。
中國政府正式駁斥了關於其國內 AI 公司非法提取美國頂尖模型數據與結果的指控。此前,Anthropic 等公司曾公開指責中國競爭對手未經授權使用其專有模型輸出。
美國公司對中國競爭對手使用 AI 蒸餾技術複製其專有模型表示擔憂。這種技術使較小的模型能夠從大型先進系統中學習,從而有效地繞過開發障礙。

360發布了安全龍蝦系列產品。這些工具以「模治模」方式構建智能體安全體系。旨在提升AI智能體部署的安全性。

OpenClaw 創辦人 @Steipete 建議勿用小模型執行高風險任務,因提示詞注入防護極弱。用戶展示在 OpenClaw AI 機器人配置 GPT-5.4,較 Claude Haiku 4.5 慢。此警告強調輕量 LLM 安全缺口。