🤖最新收集於 44m

手動配置權重的 Transformer 實現完美乘法

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡了解未經訓練的標準 Phi-3 checkpoint 如何精確乘法,以及前沿模型為何失敗。

⚡ 30-Second TL;DR

有什麼變化

Torchwright 將計算圖編譯成一般的 Phi-3 Hugging Face checkpoint。

為什麼重要

這項專案展示了只要刻意設計架構與參數,Transformer 權重也能編碼精確的符號演算法。它也凸顯了模型學習到的推理能力,與直接嵌入權重中的確定性計算之間的差異。

下一步行動

先複製 Torchwright 儲存庫並重現三位數 Phi-3 計算器,再評估編譯式演算法權重是否適合你的確定性機器學習工作負載。

誰應關注:Researchers & Academics

關鍵要點

  • Torchwright 將計算圖編譯成一般的 Phi-3 Hugging Face checkpoint。
  • 三位數模型正確處理全部 3,000,000 個支援的乘法表達式。
  • 四種設計比較了直式乘法、硬體風格、草稿紙與暴力記憶方法。
  • 六個前沿模型在較長乘法任務上表現不佳,其中五個在七位數測試中得到 0/500。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Torchwright 框架的核心機制在於將算法邏輯映射為 Transformer 的權重矩陣,利用注意力機制(Attention Mechanism)模擬計算過程中的狀態轉移與進位操作。
  • 該研究揭示了 Transformer 在處理符號邏輯任務時,透過『權重編程』(Weight Programming)而非傳統梯度下降訓練,能規避幻覺並實現確定性輸出。
  • 研究中提到的『硬體風格』(Hardware-style)設計,實際上是將 Transformer 的前饋神經網絡(FFN)層視為邏輯閘陣列,實現了類似 ALU 的運算單元。
  • 此技術不僅限於乘法,理論上可將任何可編寫為有限狀態機(FSM)的算法直接注入現有的 LLM 架構中。
  • 該方法解決了大型語言模型在處理多位數運算時常見的『長尾錯誤』問題,證明了模型權重空間中存在可精確控制的計算子空間。

🛠️ 技術深入

  • 權重注入技術:利用 Torchwright 將預定義的計算圖直接寫入 Phi-3 的權重矩陣(W_q, W_k, W_v, W_o),繞過訓練過程。
  • 狀態機映射:將直式乘法的進位邏輯編碼為 Transformer 的 KV Cache 狀態,使模型在生成過程中能維持運算狀態。
  • 確定性推理:透過將 Softmax 溫度設為 0,並設計特定的權重分佈,確保模型在執行算法時產生確定性的 Token 序列。
  • 算子實現:將乘法過程拆解為『乘法表查詢』與『加法進位』兩個階段,分別對應不同的 Transformer 層級處理。

🔮 前景展望AI analysis grounded in cited sources

權重編程將取代部分微調(Fine-tuning)流程
對於需要高度精確與邏輯一致性的任務,直接注入算法權重比依賴數據訓練更具成本效益且準確率更高。
LLM 將具備『混合架構』能力
未來模型將結合神經網絡的泛化能力與注入算法的確定性邏輯,解決目前模型在數學與邏輯推理上的可靠性瓶頸。

時間線

2026-05
Torchwright 框架初步發布,展示將算法邏輯編譯至神經網絡權重的可行性。
2026-07
研究團隊成功將直式乘法演算法注入 Phi-3 模型,並在三位數乘法測試中達到 100% 準確率。
2026-08
該技術在 Reddit r/MachineLearning 引起廣泛討論,並發布支援 12 位數乘法的進階 Checkpoint。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning