DGX Sparks 對 Mac Studio:397B 模型平手
使用者花費 96 小時在雙 DGX Sparks 和 Mac Studio M3 Ultra 上設定 Qwen3.5-397B 推理。生成速度平手 27-29 tok/s,但 Sparks 在預填充表現優異(730 tok/s 對 317),Mac 在嵌入則勝出(112 對 76.6 sentences/s)。Mac 設定僅需 4 小時,Sparks 則花 4 天。
Tag: #local-llm172 results
使用者花費 96 小時在雙 DGX Sparks 和 Mac Studio M3 Ultra 上設定 Qwen3.5-397B 推理。生成速度平手 27-29 tok/s,但 Sparks 在預填充表現優異(730 tok/s 對 317),Mac 在嵌入則勝出(112 對 76.6 sentences/s)。Mac 設定僅需 4 小時,Sparks 則花 4 天。

Qwen3.5-4B 在 Ryzen AI 7 350 XDNA2 NPU(32GB RAM)測試,使用 Lemonade v10.0.1 與 FastFlowLM v0.9.36。低功耗低於 50°C、工具呼叫、最高 256k 權重、VLMEvalKit 85.6%。支援所有 XDNA2 NPU。
Intel 計劃於 3 月 31 日推出配備 32GB VRAM 的 GPU,直接售價 949 美元。具備 608 GB/s 頻寬與 290W 功耗,針對 AI 工作站設計。適合運行如 Qwen 3.5 27B 4 位元量化的本地 AI 模型。

Google Research 推出 TurboQuant,這是一種透過極端模型壓縮重新定義 AI 效率的新技術。在 Reddit r/LocalLLaMA 上分享,預示大型模型以更少資源運行的重大進展。

Reddit 用戶透過完整磁碟掃描在 LM Studio 中偵測到精密惡意軟體,Windows Defender 多次標記。已刪除惡意軟體,但可能干擾 Windows 更新。用戶建議小心,使用 VM 或改用 Linux。
結合 Qwen3.5、Claude-4.6 和 Opus 的全新推理蒸餾模型 v2 現已在 Hugging Face 上線。社群熱切期待 27B 參數版本。經 r/LocalLLaMA Reddit 貼文分享。

text-generation-webui 4.1 版在 UI 中引入工具呼叫支援。使用者可將自訂函數製作為單一 .py 檔案,勾選核取方塊後按 Send 即可呼叫。這簡化了與本地 LLM 整合及使用自訂工具。
開發者讚揚 Qwen 3.5 122B-A10B 在本地應用建置中的自然推理能力。模型透過分析現有 API 路由進行自我引導規劃。強調開放本地 LLM 的強大威力。
Qwen 3.5 27B 在推理和知識測試中表現出色,達到大型 R1 0528 模型水準。這挑戰了小型模型變壓器架構極限的疑慮。該模型被讚譽適合微調,儘管缺乏個性。