🦙較早收集於 8h

llama.cpp 更新可能削弱 Qwen 編碼能力

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#regression#coding-assistant#local-inferencellama.cppllama.cppqwen-3.5qwen-3-coder-nextlm-studio

💡警告:近期 llama.cpp 更新可能降低 Qwen 模型編碼指令遵循

⚡ 30-Second TL;DR

有什麼變化

Qwen 3.5 和 Qwen 3 Coder Next 編碼用途降低

為什麼重要

突顯本地 LLM 工具自動更新風險,可能在編碼等特定任務回歸模型品質。

下一步行動

在 LM Studio 測試 Qwen 編碼提示前固定 llama.cpp 版本。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen 3.5 和 Qwen 3 Coder Next 編碼用途降低
  • 持續無法遵循指示
  • 嘗試不同系統提示和更高量化
  • 疑似 LM Studio 自動更新 llama.cpp
  • 問題於過去一週出現

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen 3.5 397B 在「Master-level」編碼任務中 ELO 分數從專家任務的 ~1550 驟降至 1194,主要因無法處理多檔案依賴協調[1]
  • Qwen3-Coder-Next 採用 MoE 架構,總 80B 參數僅激活 3B,即可在消費級硬體上實現高效率本地運行,支援 256K 上下文[3]
  • 開發者回報 Qwen 在長上下文和大專案中一致性不足,建議調整 num_ctx 至 32768 並使用 Q4_K_M 量化以改善效能[2][3]
  • 社區測試顯示 Qwen3 Coder Next 80B 在 16GB VRAM 上以重量化運行,複雜任務需 10-30 分鐘,但簡單任務表現優異[5]
📊 競品分析▸ Show
模型Aider 分數最佳用途VRAM (Q4)
Qwen 2.5 Coder 32B72.9%日常驅動,媲美 GPT-4o~20GB
Qwen 2.5 Coder 14B69.2%16GB GPU~9GB
Claude 3.5 Sonnet84.2%高品質雲端雲端
GLM-4.71572 ELO (Master)多檔案協調本地

🛠️ 技術深入

  • Qwen 3.5 397B 在多檔案「Master」任務中出現「協調崩潰」,無法追蹤數十檔案依賴,導致修復未正確傳播[1]
  • Qwen3-Coder-Next 使用 MoE 架構(80B 總參數,激活 3B),支援 256K 上下文,推薦 llama.cpp 而非 MLX 以改善 Mac 上 KV 快取一致性[3]
  • 常見優化:--ctx-size 32768、--n-gpu-layers 30、Q4_K_M 量化、--no-mmap 和 --fa on 旗標,提升推理速度至 20-40 tokens/sec[3]
  • 訓練數據達 36 萬億 tokens,支援 MCP 協議用於代理整合,在 Tau2-Bench 得分 74.8 超越 Claude Opus 4[2]

🔮 前景展望AI analysis grounded in cited sources

llama.cpp 更新將優先支援 MoE 優化以恢復 Qwen 編碼效能
社區已識別 KV 快取和量化問題,llama.cpp 作為開源專案快速回應本地運行需求。[3]
Qwen3-Coder-Next 將成為 16GB VRAM 主流編碼模型
其高效 MoE 設計和社區量化改進已在測試中證實可處理生產級任務,超越傳統 32B 模型。[3][5]

時間線

2025-12
Qwen 2.5 Coder 系列主宰本地編碼基準,32B 模型 Aider 得分 72.9%
2026-03
Qwen3.5 發布,向多模態代理邁進,後訓練效能於 3 月 15 日修正
2026-03
Qwen3-Coder-Next 推出,MoE 架構支援本地高效運行
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。