🦙Reddit r/LocalLLaMA•較早收集於 42m
Unsloth 修復 Qwen3.5-35B 工具呼叫
#tool-calling#quantization#rocm-inferenceqwen3.5-35b-a3bunslothqwen3.5-35b-a3bllama.cpphuggingface
💡修復後 Qwen3.5-35B 本地研究任務碾壓雲端巨頭(22字)
⚡ 30-Second TL;DR
有什麼變化
Unsloth 發布修復工具呼叫錯誤的 GGUF 量化版本
為什麼重要
讓本地 AI 從業者能使用高參數模型進行進階研究,無需依賴雲端。提升開源 LLM 在複雜工具工作流程的實用性。
下一步行動
從 Hugging Face 下載 unsloth/Qwen3.5-35B-A3B-GGUF,並透過 llama.cpp 測試工具呼叫。
誰應關注:Researchers & Academics
關鍵要點
- •Unsloth 發布修復工具呼叫錯誤的 GGUF 量化版本
- •在研究任務上超越 Gemini 和 ChatGPT 等雲端模型
- •混合線性注意力實現雙倍原生上下文,無額外記憶體
- •在 llama.cpp-ROCM 上搭配 OpenWebUI、SearXNG 和原生工具測試
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •Unsloth 進行超過 150 項 KL 散度基準測試,生成 9TB GGUF 檔案,證實其動態量化在多位元寬度上達到 SOTA 表現。
- •Qwen3.5-35B-A3B 僅啟用 3B 參數,即超越前代 Qwen3-235B-A22B 的 22B 參數,在多數基準測試中表現更優。
- •使用者在 RTX 5080 16GB GPU 上運行 Q4 量化版本,達成 200k 上下文長度下 62.98 個 token/秒的速度。
- •Unsloth Dynamic UD-Q4_K_XL 和 UD-Q3_K_XL 在 750 提示混合測試中,準確度損失低於 1 點,可大幅減少約 500GB 記憶體。
🛠️ 技術深入
- •Qwen3.5-35B-A3B 採用混合專家 (MoE) 架構,總參數 35B 但每 token 僅路由 3B 參數,結合線性注意力實現 256K 上下文無需額外 KV-cache 記憶體。
- •Unsloth Dynamic 量化優化 ffn_up_exps 和 ffn_gate_exps 可達 3-bit,ssm_out 層對低位元量化敏感,使用 Imatrix 可改善 KLD 表現。
- •修復影響所有量化版本的工具呼叫 chat template 問題,適用於 llama.cpp 等推理框架。
- •基準顯示 UD-Q4_K_XL 相較其他 Q4 量化檔案小 8GB,困惑度與實際效能相關性有限但提供參考訊號。
🔮 前景展望AI analysis grounded in cited sources
本地 MoE 模型將主導消費者級硬體部署
Qwen3.5-35B-A3B 在 16GB GPU 上支援 200k 上下文 60+ token/s,證明高效架構可取代雲端依賴。
動態量化將成為 GGUF 標準
Unsloth 9TB 基準顯示其在低位元下保持 <1% 準確度損失,大幅降低部署門檻。
工具呼叫修復加速代理應用開發
修復普遍 chat template 問題後,Qwen3.5 GGUF 可直接整合 OpenWebUI 和原生工具,提升本地代理效能。
⏳ 時間線
2025-09
Unsloth Dynamic 2.0 GGUF 發布,引入更嚴格 Aider Polyglot 基準
2026-02
Unsloth 修復 Qwen3.5 工具呼叫 chat template 問題並發布 GGUF 基準
2026-02-27
Qwen3.5-35B-A3B GGUF 更新,涵蓋 112B 和 27B 模型轉換
2026-03
社群回報 RTX 5080 上 200k 上下文 62.98 t/s 效能
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。