🦙較早收集於 45m

Qwen3.5-9B GGUF調優推理+函數呼叫

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#fine-tuned-model#function-calling#open-sourceqwen3.5-9b-ggufqwen3.5-9bggufhuggingfacellama.cpp

💡HF新GGUF模型提升本地推理+工具使用(15字元)

⚡ 30-Second TL;DR

有什麼變化

微調於推理+FunctionGemma函數呼叫資料。

為什麼重要

強化本地LLM代理應用,提升推理與函數呼叫,無雲端成本。

下一步行動

從Hugging Face下載Qwen3.5-9B GGUF,在llama.cpp測試函數呼叫。

誰應關注:Developers & AI Engineers

關鍵要點

  • 微調於推理+FunctionGemma函數呼叫資料。
  • GGUF格式支援llama.cpp、LM Studio、Ollama。
  • 專注結構化輸出、工具使用、動作導向提示。
  • Hugging Face儲存庫現已上線。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 5 個來源。

🔑 增強重點摘要

  • Qwen3.5-9B支援多模態輸入,包括視覺理解,並在推理、編碼、代理和視覺基準上超越Qwen3-VL模型。
  • 模型具備262,144 tokens的原生上下文長度,並透過可擴展強化學習在百萬代理環境中訓練,提升真實世界適應性。
  • 支援201種語言和方言,提供全球語言覆蓋,並整合閘控Delta網絡與稀疏專家混合架構以實現高效推理。
  • 量化版本如UD-Q3_K_L在GGUF評估中表現優異,VRAM使用適合7GB系統記憶體,Q2量化對小型模型損害較大。

🛠️ 技術深入

  • 參數規模:9B稠密模型,原生上下文長度262,144 tokens,最小系統記憶體需求7GB。
  • 架構特點:統一視覺語言基礎透過早期融合多模態tokens訓練;高效混合架構使用閘控Delta網絡結合稀疏Mixture-of-Experts(MoE),實現高吞吐量低延遲推理。
  • 訓練創新:近100%多模態訓練效率,異步RL框架支援大規模代理腳手與環境協調;擴展至201種語言。
  • 量化細節:GGUF版本評估顯示Q3_K_L優於Q2,FP8、NVFP4、INT4等量化變體正在測試,包括官方Qwen發布與Intel AutoRound。
  • 推論參數:預設Temperature 1、Top P 0.95、Top K 20、Presence Penalty 1.5;支援Enable Thinking模式。

🔮 前景展望AI analysis grounded in cited sources

Qwen3.5 GGUF微調將加速本地工具代理部署
其優化函數呼叫與結構化輸出結合llama.cpp等框架支援,將降低雲端依賴並提升邊緣設備代理應用。
多模態GGUF模型將主導本地推理市場
262K上下文與視覺能力加上高效量化,使其在LM Studio與Ollama中超越純文字模型,推動開源多模態採用。

時間線

2026-02
Qwen3.5系列發布,引入多模態代理與262K上下文
2026-03
Qwen3.5-9B GGUF版本上線Ollama與LM Studio
2026-03
社區發布推理+函數呼叫微調GGUF模型至Hugging Face

📎 來源 (5)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. lmstudio.ai — Qwen3.5 9b
  2. ollama.com — Qwen3.5:9b
  3. kaitchup.substack.com — More Qwen35 Gguf Evals and Speculative
  4. qwen.ai — Blog
  5. GitHub — 36456
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。