🦙較早收集於 11h

Qwen 3.6 內建 preserve_thinking 功能

Qwen 3.6 內建 preserve_thinking 功能
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#kv-cache#agent-reasoningqwen-3.6qwen-3.6lmstudioomlx

💡保留 Qwen 代理推理,修復快取問題,提升效率(24字元)

⚡ 30-Second TL;DR

有什麼變化

在聊天模板中設定 'preserve_thinking': True 而非 False

為什麼重要

提升多輪代理的一致性,減少重複權杖,並優化本地 Qwen 模型推理,利於開發者。

下一步行動

在 Qwen 3.6 模板啟用 'preserve_thinking': True,並用兩個 20 位數字提示測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • 在聊天模板中設定 'preserve_thinking': True 而非 False
  • 防止剝離先前推理,修復快取無效問題
  • 透過參照過去思考,提升代理/工具呼叫效能
  • LMStudio 尚未支援;oMLX 有開放 PR

🧠 深度解析

本篇為 AI 生成分析,非原文內容。

🔑 增強重點摘要

  • preserve_thinking 功能主要針對長上下文(Long-context)場景優化,透過在 KV 快取中保留思考過程的隱藏狀態(Hidden States),避免模型在處理多輪對話時重複進行冗長的推理計算。
  • 該功能與 Qwen 3.6 的新型推理架構(Reasoning-aware Architecture)深度整合,允許模型在執行工具呼叫(Tool Calling)前,將思考過程作為上下文的一部分進行快取,顯著降低了複雜任務的延遲。
  • 社群開發者指出,此功能對於需要頻繁進行自我修正(Self-correction)的代理(Agent)系統至關重要,因為它能讓模型直接存取先前的推理路徑,而非僅僅是最終輸出結果。
📊 競品分析▸ Show
特性Qwen 3.6 (preserve_thinking)DeepSeek-R1 (Chain-of-Thought)OpenAI o3-mini
推理快取機制原生支援 KV 快取保留依賴外部提示詞工程封閉式系統,細節未公開
代理效能高(針對工具呼叫優化)中(偏向數學與邏輯)高(整合生態系)
開放性開源權重,社群支援開源權重閉源 API

🛠️ 技術深入

  • 實作機制:透過在 Chat Template 中將 preserve_thinking 設為 True,模型會將 <think> 標籤內的 Token 序列納入 KV Cache 的保留範圍,而非在下一輪對話中將其視為無效上下文。
  • 記憶體管理:此功能利用了 Qwen 3.6 的分層快取技術(Layered Caching),將推理階段的隱藏狀態與最終回應的狀態分離,減少了長序列下的記憶體碎片化。
  • 整合需求:需要推理引擎(如 vLLM 或 llama.cpp)支援對特定 Token 區塊的強制保留標記,否則快取會因上下文長度限制而被自動覆蓋。

🔮 前景展望AI analysis grounded in cited sources

推理快取將成為開源模型代理開發的標準配置。
隨著代理任務複雜度提升,減少重複推理成本已成為提升模型回應速度的關鍵瓶頸。
未來推理模型將更依賴結構化的思考標籤。
preserve_thinking 的成功證明了將思考過程顯式化並進行快取管理,能顯著提升模型在多步驟任務中的穩定性。

時間線

2025-09
Qwen 3.0 系列發布,引入初步的推理增強架構。
2026-02
Qwen 3.5 針對長上下文處理進行架構升級。
2026-04
Qwen 3.6 正式發布,引入 preserve_thinking 功能以優化推理快取。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。