🦙Reddit r/LocalLLaMA•較早收集於 45m
Qwen3.5-9B GGUF調優推理+函數呼叫
💡HF新GGUF模型提升本地推理+工具使用(15字元)
⚡ 30-Second TL;DR
有什麼變化
微調於推理+FunctionGemma函數呼叫資料。
為什麼重要
強化本地LLM代理應用,提升推理與函數呼叫,無雲端成本。
下一步行動
從Hugging Face下載Qwen3.5-9B GGUF,在llama.cpp測試函數呼叫。
誰應關注:Developers & AI Engineers
關鍵要點
- •微調於推理+FunctionGemma函數呼叫資料。
- •GGUF格式支援llama.cpp、LM Studio、Ollama。
- •專注結構化輸出、工具使用、動作導向提示。
- •Hugging Face儲存庫現已上線。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 5 個來源。
🔑 增強重點摘要
- •Qwen3.5-9B支援多模態輸入,包括視覺理解,並在推理、編碼、代理和視覺基準上超越Qwen3-VL模型。
- •模型具備262,144 tokens的原生上下文長度,並透過可擴展強化學習在百萬代理環境中訓練,提升真實世界適應性。
- •支援201種語言和方言,提供全球語言覆蓋,並整合閘控Delta網絡與稀疏專家混合架構以實現高效推理。
- •量化版本如UD-Q3_K_L在GGUF評估中表現優異,VRAM使用適合7GB系統記憶體,Q2量化對小型模型損害較大。
🛠️ 技術深入
- •參數規模:9B稠密模型,原生上下文長度262,144 tokens,最小系統記憶體需求7GB。
- •架構特點:統一視覺語言基礎透過早期融合多模態tokens訓練;高效混合架構使用閘控Delta網絡結合稀疏Mixture-of-Experts(MoE),實現高吞吐量低延遲推理。
- •訓練創新:近100%多模態訓練效率,異步RL框架支援大規模代理腳手與環境協調;擴展至201種語言。
- •量化細節:GGUF版本評估顯示Q3_K_L優於Q2,FP8、NVFP4、INT4等量化變體正在測試,包括官方Qwen發布與Intel AutoRound。
- •推論參數:預設Temperature 1、Top P 0.95、Top K 20、Presence Penalty 1.5;支援Enable Thinking模式。
🔮 前景展望AI analysis grounded in cited sources
Qwen3.5 GGUF微調將加速本地工具代理部署
其優化函數呼叫與結構化輸出結合llama.cpp等框架支援,將降低雲端依賴並提升邊緣設備代理應用。
多模態GGUF模型將主導本地推理市場
262K上下文與視覺能力加上高效量化,使其在LM Studio與Ollama中超越純文字模型,推動開源多模態採用。
⏳ 時間線
2026-02
Qwen3.5系列發布,引入多模態代理與262K上下文
2026-03
Qwen3.5-9B GGUF版本上線Ollama與LM Studio
2026-03
社區發布推理+函數呼叫微調GGUF模型至Hugging Face
📎 來源 (5)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。