🦙較早收集於 42m

Unsloth 修復 Qwen3.5-35B 工具呼叫

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#tool-calling#quantization#rocm-inferenceqwen3.5-35b-a3bunslothqwen3.5-35b-a3bllama.cpphuggingface

💡修復後 Qwen3.5-35B 本地研究任務碾壓雲端巨頭(22字)

⚡ 30-Second TL;DR

有什麼變化

Unsloth 發布修復工具呼叫錯誤的 GGUF 量化版本

為什麼重要

讓本地 AI 從業者能使用高參數模型進行進階研究,無需依賴雲端。提升開源 LLM 在複雜工具工作流程的實用性。

下一步行動

從 Hugging Face 下載 unsloth/Qwen3.5-35B-A3B-GGUF,並透過 llama.cpp 測試工具呼叫。

誰應關注:Researchers & Academics

關鍵要點

  • Unsloth 發布修復工具呼叫錯誤的 GGUF 量化版本
  • 在研究任務上超越 Gemini 和 ChatGPT 等雲端模型
  • 混合線性注意力實現雙倍原生上下文,無額外記憶體
  • 在 llama.cpp-ROCM 上搭配 OpenWebUI、SearXNG 和原生工具測試

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Unsloth 進行超過 150 項 KL 散度基準測試,生成 9TB GGUF 檔案,證實其動態量化在多位元寬度上達到 SOTA 表現。
  • Qwen3.5-35B-A3B 僅啟用 3B 參數,即超越前代 Qwen3-235B-A22B 的 22B 參數,在多數基準測試中表現更優。
  • 使用者在 RTX 5080 16GB GPU 上運行 Q4 量化版本,達成 200k 上下文長度下 62.98 個 token/秒的速度。
  • Unsloth Dynamic UD-Q4_K_XL 和 UD-Q3_K_XL 在 750 提示混合測試中,準確度損失低於 1 點,可大幅減少約 500GB 記憶體。

🛠️ 技術深入

  • Qwen3.5-35B-A3B 採用混合專家 (MoE) 架構,總參數 35B 但每 token 僅路由 3B 參數,結合線性注意力實現 256K 上下文無需額外 KV-cache 記憶體。
  • Unsloth Dynamic 量化優化 ffn_up_exps 和 ffn_gate_exps 可達 3-bit,ssm_out 層對低位元量化敏感,使用 Imatrix 可改善 KLD 表現。
  • 修復影響所有量化版本的工具呼叫 chat template 問題,適用於 llama.cpp 等推理框架。
  • 基準顯示 UD-Q4_K_XL 相較其他 Q4 量化檔案小 8GB,困惑度與實際效能相關性有限但提供參考訊號。

🔮 前景展望AI analysis grounded in cited sources

本地 MoE 模型將主導消費者級硬體部署
Qwen3.5-35B-A3B 在 16GB GPU 上支援 200k 上下文 60+ token/s,證明高效架構可取代雲端依賴。
動態量化將成為 GGUF 標準
Unsloth 9TB 基準顯示其在低位元下保持 <1% 準確度損失,大幅降低部署門檻。
工具呼叫修復加速代理應用開發
修復普遍 chat template 問題後,Qwen3.5 GGUF 可直接整合 OpenWebUI 和原生工具,提升本地代理效能。

時間線

2025-09
Unsloth Dynamic 2.0 GGUF 發布,引入更嚴格 Aider Polyglot 基準
2026-02
Unsloth 修復 Qwen3.5 工具呼叫 chat template 問題並發布 GGUF 基準
2026-02-27
Qwen3.5-35B-A3B GGUF 更新,涵蓋 112B 和 27B 模型轉換
2026-03
社群回報 RTX 5080 上 200k 上下文 62.98 t/s 效能
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。