🦙Reddit r/LocalLLaMA•最新收集於 2h
16 張 RTX 5060 Ti 達到每秒 140 Token

💡了解本地每秒 140 token 推論所需的 PCIe、BAR1、驅動程式與平行化配置。
⚡ 30-Second TL;DR
有什麼變化
經驗證的系統使用 16 張 RTX 5060 Ti 16GB,分布於兩組各連接 8 張 GPU 的 PLX 交換器島。
為什麼重要
這套建置展示了只要精心設計 PCIe 拓撲與記憶體映射,也能使用相對平價的消費級 GPU 執行大型模型推論。對尋求本地長 context 服務的團隊而言具有參考價值,但其複雜度與非官方驅動堆疊也帶來相當大的營運風險。
下一步行動
在非正式環境機架中先建立該拓撲,並以目標 context 長度測試 DeepSeek V4 Flash-0731,再購買 16 張 GPU。
誰應關注:Developers & AI Engineers
關鍵要點
- •經驗證的系統使用 16 張 RTX 5060 Ti 16GB,分布於兩組各連接 8 張 GPU 的 PLX 交換器島。
- •Tensor Parallelism 8、Pipeline Parallelism 2 據報可在最高 500,000 token context 下達到每秒 100–150 個 token。
- •Tensor Parallelism 4、Pipeline Parallelism 4 可支援 100 萬 token context,生成速度約每秒 80 個 token。
- •系統需要修補版 NVIDIA 驅動程式、每張 GPU 16GB BAR1,以及客製化 all-reduce 和 DSpark 修改。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 22 個來源。
🔑 增強重點摘要
- •NVIDIA GeForce RTX 5060 Ti 16GB 於 2025 年 4 月 16 日發布,採用 Blackwell 架構,配備 5 代 Tensor 核心和 16GB GDDR7 記憶體,提供 189.63 INT8 AI TOPS 性能,並支援 PCIe 5.0 x8 介面。
- •DeepSeek V4 Flash-0731 是一個稀疏混合專家 (MoE) 模型,總參數為 2840 億,其中 130 億為活躍參數,並支援高達 100 萬個 token 的上下文視窗。
- •NVIDIA Blackwell 架構引入了第二代 Transformer Engine 和新的 FP4 精度,與前幾代的 FP16 相比,可將大型語言模型 (LLM) 推理吞吐量提高高達 2.5 倍。
- •PLX PEX88096 是一款 PCIe Gen 4.0 交換器,擁有 96 個活動通道和 98 個邏輯埠,旨在為 AI/ML 應用創建高效能、低延遲的 PCIe 結構,透過實現高效的 GPU 對 GPU 點對點 (P2P) 通信來避免 CPU 瓶頸。
- •DeepSeek V4 的混合注意力架構(結合了壓縮稀疏注意力 (CSA) 和重度壓縮注意力 (HCA))以及流形約束超連接 (mHC) 設計,與 DeepSeek-V3.2 相比,可將每個 token 的推理 FLOPs 減少 73%,並將 KV 快取記憶體負擔減少 90%。
📊 競品分析▸ Show
| 特性 / 面向 | 16 張 RTX 5060 Ti (本地,客製化) | 企業級 GPU (例如:NVIDIA H100/B200) | 雲端 LLM API (例如:DeepSeek V4 Flash API) |
|---|---|---|---|
| 硬體類型 | 消費級/專業級 GPU | 資料中心 GPU | 雲端基礎設施 (抽象化) |
| 硬體成本 | 約 6,864 美元 (16 * 429 美元 MSRP) | 非常高 (例如:H100 > 3 萬美元,B200 > 4 萬美元) | 不適用 (按用量付費) |
| 性能 (Token/秒) | 約 130-150 token/秒 (DeepSeek V4 Flash) | 更高 (例如:B200 對 Llama 2 70B 性能比 H100 高 4 倍) | 依供應商/模型而異,批次處理通常吞吐量高 |
| 上下文視窗 | 高達 100 萬個 token (DeepSeek V4 Flash) | 高達 100 萬個 token (DeepSeek V4 Flash 在企業級硬體上) | 高達 100 萬個 token (DeepSeek V4 Flash API) |
| 可擴展性 | 受 PCIe 通道/交換器、功耗、散熱限制 | 專為機架級、多節點擴展設計 (NVLink, InfiniBand) | 高度可擴展,由供應商管理 |
| 靈活性/控制 | 高 (完全控制硬體/軟體) | 高 (完全控制軟體,專用硬體) | 低 (供應商鎖定,客製化有限) |
| 維護/複雜性 | 非常高 (DIY,客製化驅動程式,散熱,電源) | 高 (資料中心營運,專業人員) | 低 (託管服務) |
| 功耗 | 高 (僅 GPU 就達 16 * 180W = 2880W) | 非常高 (例如:H100 700W,B200 1200W) | 不適用 (抽象化) |
| 互連 | PCIe Gen 4.0 交換器 (PLX PEX88096) | NVLink, InfiniBand (更高頻寬,更低延遲) | 網路基礎設施 (抽象化) |
| API 定價 (DeepSeek V4 Flash) | 不適用 (本地推理) | 不適用 (本地推理) | 輸入每百萬 token 0.065 美元,輸出每百萬 token 0.14 美元 |
🛠️ 技術深入
- NVIDIA GeForce RTX 5060 Ti 16GB:
- 架構: Blackwell (GB206 GPU)
- 製程: 5 奈米
- CUDA 核心: 4608 個
- Tensor 核心: 144 個第五代 Tensor 核心,支援 FP4、FP6、INT8 和 FP8 資料格式
- 記憶體: 16GB GDDR7,運行速度 28 Gbps,記憶體頻寬 448 GB/s (128 位元匯流排)
- PCIe 介面: PCI-Express 5.0 x8
- TDP: 180W
- FP32 運算性能: 23.7 TFLOPS
- INT8 AI TOPS: 189.63 TOPS (密集)
- PLX PEX88096 交換器:
- PCIe 版本: Gen 4.0 (16 GT/s 每通道)
- 總通道數: 96 個活動 PCIe Gen4 通道 (加上 2 個管理通道 = 總共 98 個)
- 邏輯埠數: 98 個 (每個埠可配置為 x1、x2、x4、x8 或 x16)
- 總雙向頻寬: 約 3.07 TB/s (全雙工)
- 交換延遲: 105 奈秒 (直通轉發)
- 特性: 內嵌 ARM Cortex R4 CPU,支援非透明橋接 (NTB) 以實現多主機通信,並能消除 PCIe 的拓撲限制,促進 GPU 對 GPU 的 P2P 通信。
- DeepSeek V4 Flash-0731 模型架構:
- 架構類型: 稀疏混合專家 (MoE) 模型
- 參數規模: 總參數 2840 億,活躍參數 130 億
- 上下文視窗: 100 萬個 token
- 注意力機制: 混合注意力機制,結合了壓縮稀疏注意力 (CSA) 和重度壓縮注意力 (HCA),顯著提高了長上下文效率。
- 連接方式: 採用流形約束超連接 (mHC) 取代標準殘差連接,增強了層間訊號傳播的穩定性。
- 優化器: 訓練時採用 Muon 優化器,以實現更快的收斂和更高的訓練穩定性。
- 效率提升: 與 DeepSeek-V3.2 相比,每個 token 的推理 FLOPs 減少 73%,KV 快取記憶體負擔減少 90%。
- DSpark: 作為 DeepSeek V4 Flash-0731 的一部分,DSpark 是一個推測解碼模組,用於提高代理能力。
- 並行化策略:
- 張量並行 (Tensor Parallelism, TP): 將神經網路中的張量沿隱藏層維度分割,並分佈到多個 GPU 上,以減少每個 GPU 的記憶體和計算負擔。所有 GPU 協同處理同一個請求,在每個層之後進行同步,最適合低延遲且 GPU 互連速度快的場景。
- 管線並行 (Pipeline Parallelism, PP): 將模型按層切片。例如,GPU 0 運行第 1-10 層,GPU 1 運行第 11-20 層,依此類推。資料像裝配線一樣流經 GPU。
- BAR1 (Base Address Register): 16GB BAR1 允許 CPU 直接存取 GPU 的更大 VRAM 區域,這對於處理大型模型或資料集特別有利,減少了 CPU 和 GPU 之間資料傳輸的潛在瓶頸。
🔮 前景展望AI analysis grounded in cited sources
消費級 GPU 將成為本地 LLM 推理的經濟高效解決方案。
本文展示了透過擴展中階消費級 GPU 陣列,可以在顯著低於企業級硬體的成本下,實現高 token 吞吐量,為個人和小型組織提供本地運行大型 LLM 的可行途徑。
先進的 PCIe 交換器在擴展 AI 工作負載的消費級 GPU 叢集方面將變得至關重要。
PLX 交換器能夠實現高效的 GPU 對 GPU 通信,繞過 CPU 瓶頸,並允許更大、更靈活的多 GPU 配置,這對於不斷增長的 LLM 規模至關重要。
軟體優化,包括客製化驅動程式和分散式推理框架,是充分利用分散式消費級 GPU 系統潛力的關鍵。
對修補版 NVIDIA 驅動程式、客製化 all-reduce 和 DSpark 修改的需求,突顯了僅有硬體是不夠的;複雜的軟體對於釋放分散式消費級 GPU 系統在 LLM 推理方面的全部潛力至關重要。
⏳ 時間線
2023-07
DeepSeek 公司成立
2023-11
DeepSeek 發布其首批模型,包括 DeepSeek Coder 和 DeepSeek-LLM
2024-08
NVIDIA Blackwell 架構首次在 MLPerf Inference v4.1 中提交性能數據
2025-01
DeepSeek-R1 模型發布,並迅速獲得廣泛關注
2025-04
NVIDIA GeForce RTX 5060 Ti (16GB 版本) 發布
2026-04
DeepSeek V4 系列 (Pro 和 Flash) 發布,支援 100 萬個 token 的上下文視窗
2026-07
DeepSeek V4 Flash-0731 (重新後訓練版本) 發布
📎 來源 (22)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。