🦙較早收集於 2h

Qwen3.5-35B 在 llama.cpp Claude Code 下崩潰

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡Qwen3.5-35B + llama.cpp claude code 崩潰 – 修復或替代方案?(22字)

⚡ 30-Second TL;DR

有什麼變化

使用 claude code 解釋器時,在第 2 或 3 個提示崩潰/卸載

為什麼重要

突顯 Qwen3.5-35B-A3B 在 llama.cpp 程式碼解釋器工作流程的相容性問題,促使使用者轉向 OpenCode 等替代方案。

下一步行動

改用 OpenCode 解釋器在 llama.cpp 上運行 Qwen3.5-35B-A3B 以避免崩潰。

誰應關注:Developers & AI Engineers

關鍵要點

  • 使用 claude code 解釋器時,在第 2 或 3 個提示崩潰/卸載
  • llama.cpp 建置:ggml-org releases 的 b8179
  • 完整提示重新處理失敗;OpenCode 成功且優於 4.7-flash
  • 尋求社群成功運行的報告

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • llama.cpp 在處理 Qwen3 系列模型時存在多個已確認的崩潰問題,特別是在長上下文(約 80K 令牌)和工具調用組合下,影響 CUDA、ROCm 和 Vulkan 等多個後端[2]
  • Qwen3.5-35B 模型在 llama.cpp 中的載入失敗問題已在版本 b8149 中修復,但後續版本(如 b8179)仍報告新的崩潰情況,表明修復不完整或引入新的迴歸[4]
  • ROCm 後端對較新 Qwen 模型的支援存在特定問題,使用者報告在 ROCm 下應用程式持續崩潰,而相同模型在 Vulkan 後端運作正常[6]

🛠️ 技術深入

  • Qwen3-Coder-Next 模型在 llama.cpp 中的崩潰與令牌位置不一致導致的解碼失敗有關[2]
  • bf16 張量載入問題:使用 bf16 張量的 GGUF 模型(如 Qwen3.5-35B-A3B-UD-Q8_K_XL)在某些工具中會產生 SIGSEGV 崩潰,但在其他實現中運作正常[3]
  • 完整提示重新處理機制在 Qwen3 模型中存在快取問題,導致不必要的完整提示重新處理和無效輸入錯誤[2]
  • 語法錯誤輸出問題源於分塊邏輯錯誤,在工具使用場景中導致輸出品質不佳[2]

🔮 前景展望AI analysis grounded in cited sources

llama.cpp 對 Qwen3 系列模型的支援需要進行全面的迴歸測試和架構級修復
多個獨立報告顯示跨越不同硬體和後端的系統性崩潰,表明問題不是邊界情況,而是核心相容性問題
ROCm 後端可能需要特定的 Qwen3 模型最佳化,以達到與 Vulkan 相同的穩定性
相同模型在 ROCm 上崩潰但在 Vulkan 上運作正常,表明後端特定的實現差異[6]

時間線

2026-02
llama.cpp b8149 版本發布,修復 Qwen3.5 模型載入失敗問題
2026-02
報告 llama.cpp b8179 中 Qwen3.5-35B 在 Claude Code 解釋器下的新崩潰問題
2026-02
確認 Qwen3-Coder-Next 80B 模型在長上下文和工具調用條件下的多後端崩潰
2026-02
識別 ROCm 後端對較新 Qwen 模型的支援問題,Vulkan 後端運作正常
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。