🦙Reddit r/LocalLLaMA•較早收集於 65m
K80 6-GPU 多工器:0.3ms 模型熱切換

#gpu-multiplexing#cheap-vram#kernel-hack#model-switching6-gpu-k80-multiplexernvidiak80rwkv-xbtc-s37
💡200 美元獲 72GB VRAM + 0.3ms 模型切換,用舊 K80—完美本地 LLM 駭客方案。(48 字)
⚡ 30-Second TL;DR
有什麼變化
3 張 K80 卡提供 72GB VRAM(總計約 200 美元)
為什麼重要
實現超低成本高 VRAM 推論設備,用於本地 LLM 實驗,重振舊硬體。讓資源有限的建置者民主化快速多模型切換。
下一步行動
在 eBay 採購 BTC-S37 主機板,並測試 K80 多工以實現低成本多模型推論。
誰應關注:Developers & AI Engineers
關鍵要點
- •3 張 K80 卡提供 72GB VRAM(總計約 200 美元)
- •6 個晶片間平均 0.3ms 切換時間
- •單 PCIe 插槽的自訂 Linux 核心模組多工
- •RWKV-X 0.2B (INT8) 解碼 38 tok/s
- •純 C 推論引擎,無 Python 依賴
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。