輕量 llama.cpp 啟動器(自動 VRAM 調校)
全新 Python 啟動器用於 llama.cpp,無依賴自動化本地推理設定。具備 VRAM 感知調校、GPU 偵測及模型特定預設。GitHub 儲存庫開放社群回饋。
Tag: #local-inference188 results
全新 Python 啟動器用於 llama.cpp,無依賴自動化本地推理設定。具備 VRAM 感知調校、GPU 偵測及模型特定預設。GitHub 儲存庫開放社群回饋。
詳述使用 llama.cpp RPC 在 RTX 5060ti(主機)和 GTX 1080ti(VM 直通)上全 GPU 運行 Qwen3.5-35B-A3B,達 60tok/s。Nemotron-3-Super-120B-A12B 使用 64GB RAM 運行 3tok/s。透過 VM 解決混合 GPU 架構驅動問題。
LM Studio 的解析器會在 <think> 區塊中掃描工具模式,靜默破壞 Qwen3.5 的工具呼叫與推理,導致無限迴圈。註冊第二個 MCP 伺服器也會破壞第一個的解析。此錯誤已報告一年多仍未修復,可透過停用推理來規避。

使用者使用 vLLM 在 2x RTX 3090 GPU 上優化 Qwen3.5 27B 密集模型,達成 100+ t/s 解碼、1500 t/s 預填充,以及 8 個請求的 585 t/s 吞吐量。主要調整包括張量並行、5 個 token 的 MTP、特定 int4 量化,以及自訂 vLLM 編譯。分享腳本和修復分支的儲存庫以供複製。

Unsloth 發布 Dynamic 2.0 GGUFs,具備智能選擇性層級量化。此更新實現更廣泛且更智能的本地 LLM 推論壓縮。由 u/paranoidray 發佈於 r/LocalLLaMA。
阿里巴巴開源 CLI 程式碼代理,處理重構與除錯等程式碼庫任務。與 LM Studio 的本地 Qwen3-Coder 無縫整合,完全離線使用。隱私分支移除所有遙測。

儘管價格上漲,配備 16GB 顯存的 GPU 仍深受玩家歡迎。Mindfactory 數據顯示,AMD Radeon RX 9070 XT 佔據近 33% 的 GPU 銷量,而 RTX 5070 是 Nvidia 上月最暢銷的 GPU。

超頻工具開發者 1usmus 更新了 Hydra,為 RTX 50 系列 GPU 加入 VRAM 與功耗上限控制功能。此次版本支援最高 +3000 MHz 的記憶體偏移。

AMD 的 Radeon RX 9070 XT 在 Mindfactory 7 月顯示卡銷售中以 725 張、33.41% 市佔率登上第一名。RX 9060 XT 以 400 張排名第二,而 16GB 顯示卡已佔銷量的 72.58%。

Lenovo 即將推出的 IdeaPad Vibe 14 與 15 筆電規格曝光,搭載 AMD Ryzen AI 300 與 400 系列處理器。據報 Lenovo 也計畫推出 Qualcomm Snapdragon 版本,定位上將瞄準 Apple 的 MacBook Neo。