🐯最新收集於 12m

反向傳播如何改變神經網路

PostLinkedIn
🐯閱讀原文: 虎嗅

💡了解這個已有數十年歷史、至今仍驅動 LLM 訓練與每次 loss.backward() 的核心演算法。

⚡ 30-Second TL;DR

有什麼變化

單層感知機無法解決 XOR 問題,暴露了多層網路中的信用分配難題。

為什麼重要

反向傳播讓多層神經網路從近乎理論性的想法,轉變為可擴展的工程平台。從小型模型到擁有數十億參數的大型語言模型,其核心抽象至今仍在發揮作用。

下一步行動

手動實作雙層網路的 dW1 與 dW2 計算,再使用 PyTorch 的 torch.autograd.gradcheck 比對梯度結果。

誰應關注:Researchers & Academics

關鍵要點

  • 單層感知機無法解決 XOR 問題,暴露了多層網路中的信用分配難題。
  • Seppo Linnainmaa、Paul Werbos,以及 1986 年 Rumelhart、Hinton、Williams 的論文,都是反向模式微分與神經網路訓練的重要里程碑。
  • 反向傳播將網路視為函數複合鏈,從損失函數反向遍歷至每個參數以計算梯度。
  • 自動微分引擎會記錄計算圖,並重用前向傳播的中間結果。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 反向傳播的數學基礎可追溯至 1970 年代早期的控制理論與自動微分研究,當時主要用於優化複雜的動力系統,而非直接應用於神經網路。
  • 反向傳播在 1980 年代中期的復興,很大程度上歸功於其解決了多層感知機(MLP)中長期存在的『梯度消失』問題的初步認知,儘管當時尚未完全克服深層網路的訓練瓶頸。
  • 現代深度學習框架(如 PyTorch 的 Autograd)採用了『動態計算圖』(Dynamic Computational Graphs),這與 1986 年原始論文中使用的靜態圖結構有顯著差異,提升了開發靈活性。
  • 反向傳播的效率優勢在於其計算複雜度與網路參數數量成線性關係,這使得它在處理擁有數十億參數的現代大型語言模型(LLM)時,仍比數值微分方法高效得多。
  • 除了鏈式法則,反向傳播的成功還依賴於優化器(如 Adam、SGD)的配合,這些優化器利用反向傳播計算出的梯度來更新權重,是現代訓練流程不可或缺的組成部分。

🛠️ 技術深入

  • 反向傳播的核心是計算損失函數 L 對權重 w 的偏導數,即梯度 ∂L/∂w。
  • 透過鏈式法則,梯度計算被分解為局部導數的乘積,從輸出層向輸入層逐層傳遞。
  • 自動微分(Automatic Differentiation)分為前向模式(Forward Mode)與反向模式(Reverse Mode),反向傳播即為反向模式的特例。
  • 記憶體管理:在計算圖中,中間層的激活值(Activations)必須被儲存以供反向傳播使用,這導致了記憶體佔用與網路深度成正比。

🔮 前景展望AI analysis grounded in cited sources

反向傳播將面臨『記憶體牆』挑戰
隨著模型參數規模持續擴大,儲存中間激活值所需的記憶體將成為訓練效率的瓶頸,促使梯度檢查點(Gradient Checkpointing)等技術成為標配。
類腦計算架構將挑戰反向傳播的主導地位
反向傳播的非局部性(Non-locality)與生物神經系統的學習機制不符,未來可能出現更具能源效率的局部學習規則(如前饋學習)來替代或輔助反向傳播。

時間線

1970-01
Seppo Linnainmaa 在其碩士論文中首次發表了反向模式自動微分的通用方法。
1974-01
Paul Werbos 在其博士論文中首次提出將反向傳播應用於神經網路訓練。
1986-10
Rumelhart、Hinton 與 Williams 發表經典論文,證實反向傳播能有效訓練多層神經網路。
2012-09
AlexNet 結合 GPU 加速與反向傳播,在 ImageNet 競賽中取得突破,開啟深度學習時代。
2015-11
Google 開源 TensorFlow,將反向傳播的自動化實現推向工業級應用。
2016-01
PyTorch 的前身及其動態圖機制開始發展,大幅簡化了反向傳播的調試與開發流程。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅