🦙較早收集於 9h

修復 Qwen 3.5 Instruct 提示重處理問題

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#chat-template#llama-cpp#prompt-fixqwen-3.5qwen-3.5llama.cpp

💡停止 Qwen 3.5 instruct 的浪費提示重處理 – 更快本地對話。(42字元)

⚡ 30-Second TL;DR

有什麼變化

修復 instruct 模式下最後訊息重處理

為什麼重要

透過防止不必要提示重處理,提升長對話效率,節省本地推理運算。

下一步行動

將模板儲存為 chat_template.jinja,並以 --chat-template-file chat_template.jinja 執行 llama.cpp。

誰應關注:Developers & AI Engineers

關鍵要點

  • 修復 instruct 模式下最後訊息重處理
  • 自訂 Jinja 模板檢查 think 區塊內容
  • 保留空 <think> 標籤避免重處理
  • 相容系統訊息中的視覺/影片
  • 35B 編碼測試無品質損失

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Qwen3.5 模型支援三種推理模式:'Fast'(快速回應)、'Thinking'(逐步推理)及 'Auto'(自適應工具使用),可透過 API 參數 'enable_thinking': False 切換非思考模式[1][4]
  • llama.cpp 對 Qwen 系列聊天模板的處理歷史上曾因剝離 區塊導致 KV 快取失效,需自訂 Jinja 模板保留空標籤以維持上下文連貫性。
  • Qwen3.5-35B-A3B 採用 MoE 架構,總參數 35B、激活 3B,原生上下文長度 262,144 令牌,可擴展至 1,010,000 令牌[4]
  • 模型透過早期視覺-語言融合訓練,支援視覺代理如 UI 操作、表單填寫及多步驟工作流程,在 MathVision 基準達 88.6 分[1][2]
📊 競品分析▸ Show
特徵/定價/基準Qwen3.5-35B-A3BQwen3-235B-A22BGPT-5.2Gemini-3 Pro
參數規模35B (3B 激活 MoE)235B (22B 激活)未公開未公開
上下文長度262K (擴至1M)未指定未指定未指定
多模態基準 (MathVision)88.6競爭性83.086.6
解碼速度提升相較前代 3.5x基準競爭未指定未指定
定價Hugging Face 開源免費未指定付費 API付費 API

🛠️ 技術深入

  • 架構:Gated Delta Networks 結合稀疏 Mixture-of-Experts (MoE),專家中間維度 512,支援多步預測 (MTP) 及 FP8 壓縮降低 50% 激活記憶體[2][4]
  • 推理模式:Instruct (非思考) 模式建議 temperature=0.7/1.0, top_p=0.8/0.95;Thinking 模式 temperature=1.0/0.6,presence_penalty 調整以避免重複[3][4]
  • 聊天模板控制:使用 /think 或 /no_think 動態切換模式,或 API 設定 'enable_thinking': False 禁用思考以避免 llama.cpp 中的提示重處理[5]
  • 多模態訓練:早期融合文本、圖像、UI 截圖及影片,詞彙擴至 250K 令牌,提升 201 語言編解碼效率 10-60%[1][2]

🔮 前景展望AI analysis grounded in cited sources

llama.cpp 社群將廣泛採用此 Jinja 模板修復 Qwen3.5 本地部署問題
該修復解決歷史 區塊重處理痛點,並相容 35B 模型無品質損失,適用多模態系統訊息[原文][4]
Qwen3.5 非思考模式將加速開源視覺代理應用
保留空 標籤避免 KV 快取重置,提升 llama.cpp 效率,支援 UI 互動及工具使用[1][2]
MoE 模型在本地推理框架相容性將持續改善
自訂模板證明 Jinja 工具可處理 Qwen 獨特標籤,預期更多社群貢獻[原文][3]

時間線

2025-12
Qwen3 發布,引入混合思考模式 (Thinking/Non-Thinking) 及代理優化[5][8]。
2026-01
Qwen3.5 推出,升級原生多模態融合、201 語言支援及 FP8 訓練[1][2][6]。
2026-02
Hugging Face 上架 Qwen3.5-35B-A3B 及 2B 模型,公開 Instruct 模式參數及上下文規格[3][4]。
2026-03
Reddit r/LocalLLaMA 發布 llama.cpp 自訂 Jinja 模板修復 Qwen3.5 Instruct 提示重處理[原文]。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。