🦙較早收集於 2h

Qwen3.5優雅推理終止

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#prompt-injection#reasoning-budget#qwen-modelsllama.cppllama.cppqwen3.5

💡llama.cpp Qwen3.5無限推理優雅終止修正(16字)

⚡ 30-Second TL;DR

有什麼變化

預算後注入「Final Answer: Based on my analysis above,」

為什麼重要

llama.cpp中Qwen3.5推理預算硬截斷修正,注入「Final Answer:」提示實現優雅摘要。300 token後測試於27B/35ba3b/9B。分享程式碼洞見,因AI生成未提PR。

下一步行動

於llama.cpp為Qwen3.5推理預算新增提示注入旗標。

誰應關注:Developers & AI Engineers

關鍵要點

  • 預算後注入「Final Answer: Based on my analysis above,」
  • 300 token後提示注入旗標 + 摘要預算
  • 成功測試Qwen3.5 27B、35ba3b、9B
  • 避免中句截斷,快速結束
  • GitHub議題:https://github.com/ggml-org/llama.cpp/issues/20632

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • llama.cpp在2026年3月合併了Model Context Protocol (MCP)支援,使本地推理引擎能直接連接MCP工具伺服器,擴展Qwen3.5的工具呼叫能力[2]
  • Qwen3.5模型系列包含多個量化版本(Q4_K_XL、Q6_K、UD-Q4_K_XL等),針對不同硬體配置最佳化,支援NVIDIA GPU、AMD ROCm和CPU推理[3][4]
  • llama.cpp在2026年3月實現了針對Qwen3.5的顯著效能改進,包括30%的提示處理加速和特定的token生成加速,同時修正了XML標籤格式工具呼叫的解析問題[2]
📊 競品分析▸ Show
特性llama.cppvLLMOllamaLM Studio
推理引擎類型C++運行時,CPU最優化生產部署,高吞吐量一鍵啟動GUI介面,非開發者友善
MCP支援是(2026年3月合併)
Qwen3.5支援是(文字和視覺)
推理速度(GB10上Qwen3.5-35B)~43 tok/s生成~28 tok/s(Q6量化)未指定未指定
硬體支援NVIDIA/AMD/CPUNVIDIA優先跨平台跨平台

🛠️ 技術深入

  • 上下文管理:llama.cpp採用預設的「旋轉」上下文管理,-c參數控制最大上下文長度(預設4096),-n控制每次最大生成長度;支援YaRN位置插值以擴展至131,072 token[1]
  • 量化支援:Qwen3.5支援多種量化格式(Q4_K_XL、Q6_K、UD-Q4_K_XL、IQ4_XS),MXFP4量化限NVIDIA專用[3]
  • GPU卸載-ngl 99 -dev cuda0,cuda1 -sm row將所有層卸載至GPU,支援多GPU分割模式;-fa標誌可進一步加速生成[1]
  • 採樣參數:支援--presence-penalty(建議最高2.0以防止重複),--top-k--top-p--min-p--temp等參數調整[1]
  • 工具呼叫:Qwen3.5支援XML標籤格式工具呼叫,2026年3月修正了參數格式解析問題;支援--tool-call-parser qwen3_coder[2][3]
  • 推理效能:ik_llama.cpp分支在CPU推理上展現5倍提示處理速度和1.7倍token生成速度提升(Zen5 CPU上Qwen3.5 4B IQ4_XS測試)[2]

🔮 前景展望AI analysis grounded in cited sources

MCP整合將推動本地AI代理框架的採用
llama.cpp的MCP支援使本地推理能與Claude和OpenClaw使用的相同協議相容,降低本地代理部署的技術障礙[2]
CPU推理優化將擴大無GPU環境的模型可用性
ik_llama.cpp的5倍加速表明CPU推理正成為可行的替代方案,可能推動邊緣設備和資源受限環境的部署[2]

時間線

2026-03
llama.cpp合併Model Context Protocol支援,啟用本地MCP工具伺服器整合
2026-03
llama.cpp發佈Qwen3.5特定最佳化,包括30%提示處理加速和XML工具呼叫解析修正
2026-03
Qwen3.5-Coder-Next模型發佈,在程式碼生成基準測試中排名第一
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。