🦙Reddit r/LocalLLaMA•較早收集於 9h
修復 Qwen 3.5 Instruct 提示重處理問題
#chat-template#llama-cpp#prompt-fixqwen-3.5qwen-3.5llama.cpp
💡停止 Qwen 3.5 instruct 的浪費提示重處理 – 更快本地對話。(42字元)
⚡ 30-Second TL;DR
有什麼變化
修復 instruct 模式下最後訊息重處理
為什麼重要
透過防止不必要提示重處理,提升長對話效率,節省本地推理運算。
下一步行動
將模板儲存為 chat_template.jinja,並以 --chat-template-file chat_template.jinja 執行 llama.cpp。
誰應關注:Developers & AI Engineers
關鍵要點
- •修復 instruct 模式下最後訊息重處理
- •自訂 Jinja 模板檢查 think 區塊內容
- •保留空 <think> 標籤避免重處理
- •相容系統訊息中的視覺/影片
- •35B 編碼測試無品質損失
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •Qwen3.5 模型支援三種推理模式:'Fast'(快速回應)、'Thinking'(逐步推理)及 'Auto'(自適應工具使用),可透過 API 參數 'enable_thinking': False 切換非思考模式[1][4]。
- •llama.cpp 對 Qwen 系列聊天模板的處理歷史上曾因剝離
區塊導致 KV 快取失效,需自訂 Jinja 模板保留空標籤以維持上下文連貫性。 - •Qwen3.5-35B-A3B 採用 MoE 架構,總參數 35B、激活 3B,原生上下文長度 262,144 令牌,可擴展至 1,010,000 令牌[4]。
- •模型透過早期視覺-語言融合訓練,支援視覺代理如 UI 操作、表單填寫及多步驟工作流程,在 MathVision 基準達 88.6 分[1][2]。
📊 競品分析▸ Show
| 特徵/定價/基準 | Qwen3.5-35B-A3B | Qwen3-235B-A22B | GPT-5.2 | Gemini-3 Pro |
|---|---|---|---|---|
| 參數規模 | 35B (3B 激活 MoE) | 235B (22B 激活) | 未公開 | 未公開 |
| 上下文長度 | 262K (擴至1M) | 未指定 | 未指定 | 未指定 |
| 多模態基準 (MathVision) | 88.6 | 競爭性 | 83.0 | 86.6 |
| 解碼速度提升 | 相較前代 3.5x | 基準競爭 | 未指定 | 未指定 |
| 定價 | Hugging Face 開源免費 | 未指定 | 付費 API | 付費 API |
🛠️ 技術深入
- •架構:Gated Delta Networks 結合稀疏 Mixture-of-Experts (MoE),專家中間維度 512,支援多步預測 (MTP) 及 FP8 壓縮降低 50% 激活記憶體[2][4]。
- •推理模式:Instruct (非思考) 模式建議 temperature=0.7/1.0, top_p=0.8/0.95;Thinking 模式 temperature=1.0/0.6,presence_penalty 調整以避免重複[3][4]。
- •聊天模板控制:使用 /think 或 /no_think 動態切換模式,或 API 設定 'enable_thinking': False 禁用思考以避免 llama.cpp 中的提示重處理[5]。
- •多模態訓練:早期融合文本、圖像、UI 截圖及影片,詞彙擴至 250K 令牌,提升 201 語言編解碼效率 10-60%[1][2]。
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2025-12
Qwen3 發布,引入混合思考模式 (Thinking/Non-Thinking) 及代理優化[5][8]。
2026-01
Qwen3.5 推出,升級原生多模態融合、201 語言支援及 FP8 訓練[1][2][6]。
2026-02
Hugging Face 上架 Qwen3.5-35B-A3B 及 2B 模型,公開 Instruct 模式參數及上下文規格[3][4]。
2026-03
Reddit r/LocalLLaMA 發布 llama.cpp 自訂 Jinja 模板修復 Qwen3.5 Instruct 提示重處理[原文]。
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
