🦙Reddit r/LocalLLaMA•較早收集於 2h
Qwen3.5優雅推理終止
#prompt-injection#reasoning-budget#qwen-modelsllama.cppllama.cppqwen3.5
💡llama.cpp Qwen3.5無限推理優雅終止修正(16字)
⚡ 30-Second TL;DR
有什麼變化
預算後注入「Final Answer: Based on my analysis above,」
為什麼重要
llama.cpp中Qwen3.5推理預算硬截斷修正,注入「Final Answer:」提示實現優雅摘要。300 token後測試於27B/35ba3b/9B。分享程式碼洞見,因AI生成未提PR。
下一步行動
於llama.cpp為Qwen3.5推理預算新增提示注入旗標。
誰應關注:Developers & AI Engineers
關鍵要點
- •預算後注入「Final Answer: Based on my analysis above,」
- •300 token後提示注入旗標 + 摘要預算
- •成功測試Qwen3.5 27B、35ba3b、9B
- •避免中句截斷,快速結束
- •GitHub議題:https://github.com/ggml-org/llama.cpp/issues/20632
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
📊 競品分析▸ Show
| 特性 | llama.cpp | vLLM | Ollama | LM Studio |
|---|---|---|---|---|
| 推理引擎類型 | C++運行時,CPU最優化 | 生產部署,高吞吐量 | 一鍵啟動 | GUI介面,非開發者友善 |
| MCP支援 | 是(2026年3月合併) | 否 | 否 | 否 |
| Qwen3.5支援 | 是(文字和視覺) | 是 | 是 | 是 |
| 推理速度(GB10上Qwen3.5-35B) | ~43 tok/s生成 | ~28 tok/s(Q6量化) | 未指定 | 未指定 |
| 硬體支援 | NVIDIA/AMD/CPU | NVIDIA優先 | 跨平台 | 跨平台 |
🛠️ 技術深入
- 上下文管理:llama.cpp採用預設的「旋轉」上下文管理,
-c參數控制最大上下文長度(預設4096),-n控制每次最大生成長度;支援YaRN位置插值以擴展至131,072 token[1] - 量化支援:Qwen3.5支援多種量化格式(Q4_K_XL、Q6_K、UD-Q4_K_XL、IQ4_XS),MXFP4量化限NVIDIA專用[3]
- GPU卸載:
-ngl 99 -dev cuda0,cuda1 -sm row將所有層卸載至GPU,支援多GPU分割模式;-fa標誌可進一步加速生成[1] - 採樣參數:支援
--presence-penalty(建議最高2.0以防止重複),--top-k、--top-p、--min-p、--temp等參數調整[1] - 工具呼叫:Qwen3.5支援XML標籤格式工具呼叫,2026年3月修正了參數格式解析問題;支援
--tool-call-parser qwen3_coder[2][3] - 推理效能:ik_llama.cpp分支在CPU推理上展現5倍提示處理速度和1.7倍token生成速度提升(Zen5 CPU上Qwen3.5 4B IQ4_XS測試)[2]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-03
llama.cpp合併Model Context Protocol支援,啟用本地MCP工具伺服器整合
2026-03
llama.cpp發佈Qwen3.5特定最佳化,包括30%提示處理加速和XML工具呼叫解析修正
2026-03
Qwen3.5-Coder-Next模型發佈,在程式碼生成基準測試中排名第一
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- qwen.readthedocs.io — Llama.cpp
- buttondown.com — This Week in Local AI Llamacpp Gets Mcp Qwen3
- dev.to — Qwen3 Coder Next the Complete 2026 Guide to Running Powerful AI Coding Agents Locally 1k95
- forums.developer.nvidia.com — 363196
- forums.developer.nvidia.com — 362000
- GitHub — 32916
- till-freitag.com — Open Source LLM Comparison
- GitHub — Qwen3
- latent.space — Ainews the Unreasonable Effectiveness
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。