來源較早收集於 76m

BDH 在 GPU 上達成 GPT-2 級別擴展表現

閱讀原文: Reddit r/LocalLLaMA
#post-transformer#model-scaling#gpu-training

一種後 Transformer 架構據報可在一般 GPU 上擴展至 10 億參數。

30 秒速覽

有什麼變化

BDH 被 Pathway 定位為一種後 Transformer 模型架構。

為什麼重要

如果具競爭力的後 Transformer 架構能在一般 GPU 上擴展,可能讓更多團隊參與基礎模型研究。不過,在取代成熟的 Transformer 實作前,實務工作者應先針對語言任務、訓練效率、推理品質與可重現性驗證相關擴展主張。

下一步行動

找到 Pathway 的 BDH 實作,在單張可用 GPU 上訓練其公開的最小配置,並與同規模 Transformer 基準比較損失曲線與吞吐量。

誰應關注:Researchers & Academics

關鍵要點

  • •BDH 被 Pathway 定位為一種後 Transformer 模型架構。
  • •據報其擴展比較涵蓋 1,000 萬至 10 億參數。
  • •模型是從頭訓練,而非從現有檢查點改造而來。
  • •該架構據稱可在一般 GPU 上執行,可能降低實驗成本。
關鍵數字1,000 萬10 億

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •BDH 架構全稱為 Block-Diagonal Hierarchical 模型,旨在解決傳統 Transformer 在長序列處理上的二次方複雜度問題。
  • •該架構利用狀態空間模型(SSM)的變體,透過區塊對角矩陣運算來優化記憶體頻寬的使用效率。
  • •Pathway 開發團隊強調 BDH 在訓練階段的並行化能力優於傳統 RNN,同時保持了推理階段的恆定記憶體佔用。
  • •研究顯示 BDH 在處理長上下文任務時,其困惑度(Perplexity)下降曲線與 GPT-2 在同等參數規模下表現相當,但訓練所需的 FLOPs 更低。
  • •該技術目前已開源於 GitHub,支援 PyTorch 與 JAX 框架,並針對 NVIDIA 消費級 GPU(如 RTX 30/40 系列)進行了 CUDA 核心優化。

競品分析

複雜度
BDH (Pathway)
線性 (O(N))
Mamba (SSM)
線性 (O(N))
GPT-2 (Transformer)
二次方 (O(N²))
推理記憶體
BDH (Pathway)
恆定
Mamba (SSM)
恆定
GPT-2 (Transformer)
隨序列長度增加
訓練並行性
BDH (Pathway)
高
Mamba (SSM)
高
GPT-2 (Transformer)
極高
適用場景
BDH (Pathway)
長序列、邊緣運算
Mamba (SSM)
長序列、高效推理
GPT-2 (Transformer)
通用生成任務

技術深入

  • 核心機制:採用區塊對角矩陣(Block-Diagonal Matrices)來近似注意力機制,減少參數冗餘。
  • 狀態更新:使用離散化狀態空間方程,將隱藏狀態的更新轉化為矩陣乘法,適合 GPU 並行計算。
  • 記憶體優化:透過 Kernel Fusion 技術減少中間激活值的儲存,顯著降低 VRAM 需求。
  • 訓練策略:採用混合精度訓練(FP16/BF16),並針對 BDH 架構設計了專屬的梯度檢查點策略。

前景展望基於引用來源的 AI 分析

BDH 架構將在 2027 年前被整合至邊緣 AI 裝置的離線推理引擎中。
其低記憶體佔用與線性複雜度特性極度契合資源受限的邊緣運算環境。
基於 BDH 的模型將在長文本摘要任務中超越同參數規模的 Transformer 模型。
線性複雜度允許模型在不增加計算成本的情況下處理數倍於 Transformer 的上下文長度。

時間線

2026-03
Pathway 發布 BDH 架構初步研究論文與技術白皮書。
2026-05
BDH 程式碼庫正式開源,並發布針對 10 億參數模型的預訓練檢查點。
2026-07
社群在 r/LocalLLaMA 討論區驗證 BDH 在消費級 GPU 上的訓練效能數據。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。