來源較早收集於 35m

Qwen3.5 過度思考膠帶修復:預算旗標

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#reasoning-fix#inference-hack#qwen-tuningqwen3.5qwen3.5llama.cpp

💡兩個 llama.cpp 旗標終止 Qwen3.5 無盡思考循環(20字)

⚡ 30 秒速覽

有什麼變化

--reasoning-budget 4096 在令牌上限停止

為什麼重要

快速修復提升 Qwen3.5 在推論引擎的可用性,避免冗長輸出。適用即時本地部署。

下一步行動

使用 --reasoning-budget 1024 --reasoning-budget-message '. Okay enough thinking.' 執行 llama-server 於 Qwen3.5。

誰應關注:Developers & AI Engineers

關鍵要點

  • --reasoning-budget 4096 在令牌上限停止
  • --reasoning-budget-message 附加「夠了思考」
  • 在 Qwen3.5-35B-A3B Q4_K_M 上 ROCm 測試
  • 較低預算更快但降低答案品質

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 6 個來源。

🔑 增強重點摘要

  • Qwen3.5 採用混合專家(MoE)架構,總參數達 3970 億,每提示僅啟用 170 億參數,提升硬體效率。[1][4]
  • Qwen3.5 在 IFBench 指令遵循基準測試中超越 GPT-5.2 與 Claude 4.5 Opus,並在 HMMT 推理基準優於 Claude 4.5 Opus。[1]
  • Qwen3.5 支援高達 262,144 令牌上下文長度,可透過自訂擴展至近四倍,並處理超過 210 種語言與圖像輸入。[1]

🛠️ 技術深入

  • Qwen3.5 使用混合專家模型,包含多個針對不同任務優化的神經網路,每提示僅啟用 10 個專家網路,總參數 3970 億,啟用 170 億。[1][4]
  • 結合標準二次注意力頭與線性注意力頭,顯著降低記憶體需求,避免二次縮放問題。[1]
  • 預訓練資料集擴展至約 36 萬億令牌,涵蓋 119 種語言,包括網路資料與 PDF 文件;訓練分三階段:S1 基本語言(30 萬億令牌,4K 上下文)、S2 知識密集資料(5 萬億令牌)、S3 長上下文擴展至 32K。[2]

🔮 前景展望基於引用來源的 AI 分析

llama.cpp 的 --reasoning-budget 旗標將成為處理 Qwen 系列過度思考的標準工具
Qwen3 引入思考/非思考混合模式,Qwen3.5 延續此設計,llama.cpp 修復直接針對其內建推理機制,提供使用者精確控制。[2][3]
Qwen3.5 MoE 架構將加速開源模型在邊緣設備部署
其高效混合架構僅啟用部分參數,適合手機與舊筆電,優化推理成本達 60% 降低與八倍大工作負載處理。[3][4]

時間線

2025-04
Qwen3 發布,引入思考/非思考混合模式與高達 235B MoE 模型
2026-02
Alibaba 發布 Qwen3.5 多模態 MoE 模型,支援 262K 令牌與視覺代理能力
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。