🦙最新收集於 2h

16 張 RTX 5060 Ti 達到每秒 140 Token

16 張 RTX 5060 Ti 達到每秒 140 Token
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡了解本地每秒 140 token 推論所需的 PCIe、BAR1、驅動程式與平行化配置。

⚡ 30-Second TL;DR

有什麼變化

經驗證的系統使用 16 張 RTX 5060 Ti 16GB,分布於兩組各連接 8 張 GPU 的 PLX 交換器島。

為什麼重要

這套建置展示了只要精心設計 PCIe 拓撲與記憶體映射,也能使用相對平價的消費級 GPU 執行大型模型推論。對尋求本地長 context 服務的團隊而言具有參考價值,但其複雜度與非官方驅動堆疊也帶來相當大的營運風險。

下一步行動

在非正式環境機架中先建立該拓撲,並以目標 context 長度測試 DeepSeek V4 Flash-0731,再購買 16 張 GPU。

誰應關注:Developers & AI Engineers

關鍵要點

  • 經驗證的系統使用 16 張 RTX 5060 Ti 16GB,分布於兩組各連接 8 張 GPU 的 PLX 交換器島。
  • Tensor Parallelism 8、Pipeline Parallelism 2 據報可在最高 500,000 token context 下達到每秒 100–150 個 token。
  • Tensor Parallelism 4、Pipeline Parallelism 4 可支援 100 萬 token context,生成速度約每秒 80 個 token。
  • 系統需要修補版 NVIDIA 驅動程式、每張 GPU 16GB BAR1,以及客製化 all-reduce 和 DSpark 修改。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 22 個來源。

🔑 增強重點摘要

  • NVIDIA GeForce RTX 5060 Ti 16GB 於 2025 年 4 月 16 日發布,採用 Blackwell 架構,配備 5 代 Tensor 核心和 16GB GDDR7 記憶體,提供 189.63 INT8 AI TOPS 性能,並支援 PCIe 5.0 x8 介面。
  • DeepSeek V4 Flash-0731 是一個稀疏混合專家 (MoE) 模型,總參數為 2840 億,其中 130 億為活躍參數,並支援高達 100 萬個 token 的上下文視窗。
  • NVIDIA Blackwell 架構引入了第二代 Transformer Engine 和新的 FP4 精度,與前幾代的 FP16 相比,可將大型語言模型 (LLM) 推理吞吐量提高高達 2.5 倍。
  • PLX PEX88096 是一款 PCIe Gen 4.0 交換器,擁有 96 個活動通道和 98 個邏輯埠,旨在為 AI/ML 應用創建高效能、低延遲的 PCIe 結構,透過實現高效的 GPU 對 GPU 點對點 (P2P) 通信來避免 CPU 瓶頸。
  • DeepSeek V4 的混合注意力架構(結合了壓縮稀疏注意力 (CSA) 和重度壓縮注意力 (HCA))以及流形約束超連接 (mHC) 設計,與 DeepSeek-V3.2 相比,可將每個 token 的推理 FLOPs 減少 73%,並將 KV 快取記憶體負擔減少 90%。
📊 競品分析▸ Show
特性 / 面向16 張 RTX 5060 Ti (本地,客製化)企業級 GPU (例如:NVIDIA H100/B200)雲端 LLM API (例如:DeepSeek V4 Flash API)
硬體類型消費級/專業級 GPU資料中心 GPU雲端基礎設施 (抽象化)
硬體成本約 6,864 美元 (16 * 429 美元 MSRP)非常高 (例如:H100 > 3 萬美元,B200 > 4 萬美元)不適用 (按用量付費)
性能 (Token/秒)約 130-150 token/秒 (DeepSeek V4 Flash)更高 (例如:B200 對 Llama 2 70B 性能比 H100 高 4 倍)依供應商/模型而異,批次處理通常吞吐量高
上下文視窗高達 100 萬個 token (DeepSeek V4 Flash)高達 100 萬個 token (DeepSeek V4 Flash 在企業級硬體上)高達 100 萬個 token (DeepSeek V4 Flash API)
可擴展性受 PCIe 通道/交換器、功耗、散熱限制專為機架級、多節點擴展設計 (NVLink, InfiniBand)高度可擴展,由供應商管理
靈活性/控制高 (完全控制硬體/軟體)高 (完全控制軟體,專用硬體)低 (供應商鎖定,客製化有限)
維護/複雜性非常高 (DIY,客製化驅動程式,散熱,電源)高 (資料中心營運,專業人員)低 (託管服務)
功耗高 (僅 GPU 就達 16 * 180W = 2880W)非常高 (例如:H100 700W,B200 1200W)不適用 (抽象化)
互連PCIe Gen 4.0 交換器 (PLX PEX88096)NVLink, InfiniBand (更高頻寬,更低延遲)網路基礎設施 (抽象化)
API 定價 (DeepSeek V4 Flash)不適用 (本地推理)不適用 (本地推理)輸入每百萬 token 0.065 美元,輸出每百萬 token 0.14 美元

🛠️ 技術深入

  • NVIDIA GeForce RTX 5060 Ti 16GB:
    • 架構: Blackwell (GB206 GPU)
    • 製程: 5 奈米
    • CUDA 核心: 4608 個
    • Tensor 核心: 144 個第五代 Tensor 核心,支援 FP4、FP6、INT8 和 FP8 資料格式
    • 記憶體: 16GB GDDR7,運行速度 28 Gbps,記憶體頻寬 448 GB/s (128 位元匯流排)
    • PCIe 介面: PCI-Express 5.0 x8
    • TDP: 180W
    • FP32 運算性能: 23.7 TFLOPS
    • INT8 AI TOPS: 189.63 TOPS (密集)
  • PLX PEX88096 交換器:
    • PCIe 版本: Gen 4.0 (16 GT/s 每通道)
    • 總通道數: 96 個活動 PCIe Gen4 通道 (加上 2 個管理通道 = 總共 98 個)
    • 邏輯埠數: 98 個 (每個埠可配置為 x1、x2、x4、x8 或 x16)
    • 總雙向頻寬: 約 3.07 TB/s (全雙工)
    • 交換延遲: 105 奈秒 (直通轉發)
    • 特性: 內嵌 ARM Cortex R4 CPU,支援非透明橋接 (NTB) 以實現多主機通信,並能消除 PCIe 的拓撲限制,促進 GPU 對 GPU 的 P2P 通信。
  • DeepSeek V4 Flash-0731 模型架構:
    • 架構類型: 稀疏混合專家 (MoE) 模型
    • 參數規模: 總參數 2840 億,活躍參數 130 億
    • 上下文視窗: 100 萬個 token
    • 注意力機制: 混合注意力機制,結合了壓縮稀疏注意力 (CSA) 和重度壓縮注意力 (HCA),顯著提高了長上下文效率。
    • 連接方式: 採用流形約束超連接 (mHC) 取代標準殘差連接,增強了層間訊號傳播的穩定性。
    • 優化器: 訓練時採用 Muon 優化器,以實現更快的收斂和更高的訓練穩定性。
    • 效率提升: 與 DeepSeek-V3.2 相比,每個 token 的推理 FLOPs 減少 73%,KV 快取記憶體負擔減少 90%。
    • DSpark: 作為 DeepSeek V4 Flash-0731 的一部分,DSpark 是一個推測解碼模組,用於提高代理能力。
  • 並行化策略:
    • 張量並行 (Tensor Parallelism, TP): 將神經網路中的張量沿隱藏層維度分割,並分佈到多個 GPU 上,以減少每個 GPU 的記憶體和計算負擔。所有 GPU 協同處理同一個請求,在每個層之後進行同步,最適合低延遲且 GPU 互連速度快的場景。
    • 管線並行 (Pipeline Parallelism, PP): 將模型按層切片。例如,GPU 0 運行第 1-10 層,GPU 1 運行第 11-20 層,依此類推。資料像裝配線一樣流經 GPU。
    • BAR1 (Base Address Register): 16GB BAR1 允許 CPU 直接存取 GPU 的更大 VRAM 區域,這對於處理大型模型或資料集特別有利,減少了 CPU 和 GPU 之間資料傳輸的潛在瓶頸。

🔮 前景展望AI analysis grounded in cited sources

消費級 GPU 將成為本地 LLM 推理的經濟高效解決方案。
本文展示了透過擴展中階消費級 GPU 陣列,可以在顯著低於企業級硬體的成本下,實現高 token 吞吐量,為個人和小型組織提供本地運行大型 LLM 的可行途徑。
先進的 PCIe 交換器在擴展 AI 工作負載的消費級 GPU 叢集方面將變得至關重要。
PLX 交換器能夠實現高效的 GPU 對 GPU 通信,繞過 CPU 瓶頸,並允許更大、更靈活的多 GPU 配置,這對於不斷增長的 LLM 規模至關重要。
軟體優化,包括客製化驅動程式和分散式推理框架,是充分利用分散式消費級 GPU 系統潛力的關鍵。
對修補版 NVIDIA 驅動程式、客製化 all-reduce 和 DSpark 修改的需求,突顯了僅有硬體是不夠的;複雜的軟體對於釋放分散式消費級 GPU 系統在 LLM 推理方面的全部潛力至關重要。

時間線

2023-07
DeepSeek 公司成立
2023-11
DeepSeek 發布其首批模型,包括 DeepSeek Coder 和 DeepSeek-LLM
2024-08
NVIDIA Blackwell 架構首次在 MLPerf Inference v4.1 中提交性能數據
2025-01
DeepSeek-R1 模型發布,並迅速獲得廣泛關注
2025-04
NVIDIA GeForce RTX 5060 Ti (16GB 版本) 發布
2026-04
DeepSeek V4 系列 (Pro 和 Flash) 發布,支援 100 萬個 token 的上下文視窗
2026-07
DeepSeek V4 Flash-0731 (重新後訓練版本) 發布
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。