🦙較早收集於 65m

K80 6-GPU 多工器:0.3ms 模型熱切換

K80 6-GPU 多工器:0.3ms 模型熱切換
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#gpu-multiplexing#cheap-vram#kernel-hack#model-switching6-gpu-k80-multiplexernvidiak80rwkv-xbtc-s37

💡200 美元獲 72GB VRAM + 0.3ms 模型切換,用舊 K80—完美本地 LLM 駭客方案。(48 字)

⚡ 30-Second TL;DR

有什麼變化

3 張 K80 卡提供 72GB VRAM(總計約 200 美元)

為什麼重要

實現超低成本高 VRAM 推論設備,用於本地 LLM 實驗,重振舊硬體。讓資源有限的建置者民主化快速多模型切換。

下一步行動

在 eBay 採購 BTC-S37 主機板,並測試 K80 多工以實現低成本多模型推論。

誰應關注:Developers & AI Engineers

關鍵要點

  • 3 張 K80 卡提供 72GB VRAM(總計約 200 美元)
  • 6 個晶片間平均 0.3ms 切換時間
  • 單 PCIe 插槽的自訂 Linux 核心模組多工
  • RWKV-X 0.2B (INT8) 解碼 38 tok/s
  • 純 C 推論引擎,無 Python 依賴
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。