
中國 RTX 4080 32GB 三風扇版 1300 歐元
用戶從中國以約 1300 歐元購買 32GB RTX 4080 三風扇 GPU,認為對應 VRAM 量而言價格合理。該卡運行順暢且安靜,得益於三風扇設計。他們詢問首批測試建議。
Tag: #local-inference188 results

用戶從中國以約 1300 歐元購買 32GB RTX 4080 三風扇 GPU,認為對應 VRAM 量而言價格合理。該卡運行順暢且安靜,得益於三風扇設計。他們詢問首批測試建議。
llama.cpp 的一個實驗性拉取請求引入了 CPU 卸載期間的權重預取功能。它提升了密集模型和小 MoE 模型的效能。適合 RAM 充足但 GPU 不足的使用者。
Qwen3.5 27B 在 RTX 3090 + RTX Pro 4000 上真實電費:未快取輸入 0.026€/百萬令牌、輸出 0.829€/百萬令牌(0.30€/kWh)。測量生成 53.8 TPS、提示 1691 TPS、535W 耗電。計劃測試 llama.cpp 變體。
使用者測試顯示 Qwen3.5-27B (Q6_K_XL) 在開發任務匹敵 Nemotron-120B、Qwen3.5-122B 及 GPT-5.4。在 2x RTX 3090 上達 803pp/25tg,256k 上下文。可取代 API 訂閱用於日常編碼。
ik_llama.cpp 的集中文件頁面現列出所有參數、範例與旗標。最近改進旨在幫助新手與專家提升每秒權重 (t/s)。鼓勵使用者分享效能結果。
使用 llama.cpp 和 OpenCode 測試老舊 Titan X Pascal GPU 於本地 AI 任務。達成 500 令牌/秒提示處理及 25 令牌/秒生成速度,生成速度為 AMD 9070 XT 一半但相當競爭。證明舊硬體仍適用推論。

網友瘋搶 Mac mini 來「養龍蝦」(OpenClaw AI 專案)。文章推薦更值得抄襲的優越玩法,而非跟風熱潮。OpenClaw 正在主宰趨勢。

使用者在 Claude Code 中使用本地 Qwen3.5 35B A3B (Q2_K_XL/Q4_K_M) 建置寵物專案,有效處理工具使用與子代理等複雜任務。一個 2 分鐘工作階段消耗 2M 權重,相當於 Claude Sonnet 4.6 的 10.85 美元,僅耗電費。強調未來 Qwen 開源模型的不確定性。

蘋果新MacBook Pro行銷頁展示Qwen3-Coder在LM Studio運行。此舉認可中國AI模型的能力。Mac適合本地LLM推理。
使用者偏好 35B A3B MoE 在 16GB VRAM/64GB RAM 上達 49-55 t/s,勝過 9B 的 23 t/s。對 35B 效能愛不釋手。提及 9B 傳聞勝過 120B OSS 模型。