ResBM:管線訓練 128 倍壓縮
Macrocosmos 論文推出 ResBM,一種用於低頻寬管線並行訓練的 transformer 架構,實現 SOTA 128 倍激活壓縮。具備跨階段殘差編碼器-解碼器瓶頸,保留低階身份路徑。針對去中心化/網際網路級訓練,使用 Muon 測試。
Tag: #transformers19 results
Macrocosmos 論文推出 ResBM,一種用於低頻寬管線並行訓練的 transformer 架構,實現 SOTA 128 倍激活壓縮。具備跨階段殘差編碼器-解碼器瓶頸,保留低階身份路徑。針對去中心化/網際網路級訓練,使用 Muon 測試。
本系列教學深入探討 FlashAttention 的理論基礎,將其定義為一種隱含結合律的運算。文中探討了這種數學視角如何實現 GPU 排程優化與高效的 CUDA 核心實作。

總部位於邁阿密的 AI 新創公司 Subquadratic 結束隱身狀態,聲稱已解決大型語言模型中存在已久的數學瓶頸。儘管最初受到質疑,該公司目前正開始提供技術證據以支持其說法。

獨立研究者開發權重範數裁剪,在優化器步驟後對解碼器權重施加逐行 L2 裁剪,在模運算 grokking 基準上實現 2 層模型 66 倍加速、8 層模型 18 倍加速,對比基線無一失敗達 300 種子。程式碼與 PDF 在 GitHub 上;大型 LLM 測試進行中。

NVIDIA 開發者部落格詳細說明使用 cuTile Python 實作 Flash Attention,這是現代 AI 的關鍵工作負載,以達峰值效能。它涵蓋透過 quickstart 文件的環境設定,以及 transformer 模型核心的 attention 機制。從業者可學習優化 token 處理的技巧。
作者使用 Torchwright 將小學直式乘法演算法直接編譯進一般的 Phi-3 checkpoint,完全不需訓練。這個三位數計算器在 3,000,000 個支援的表達式上達到 100% 準確率,另有支援 12 位數乘法的 checkpoint。

新 SATFormer 論文提出逐 token、逐 head 閘門,選擇性存取 Transformer 第一層 value。於損失與檢索基準優於基線,吞吐量近基線。提供 ArXiv 與 GitHub 連結。

移除自注意力/交叉注意力的位置編碼後,注意力熱圖出現垂直熱線。無 PE 時查詢均勻關注相同鍵。正規化擴散注意力但保留垂直模式;尋求基於查詢的動態注意力方法。

這篇ArXiv論文探討Transformer模型的資料增強策略,用以解決NGSS科學解釋AI評分中的類別不平衡問題。使用1,466個學生回應的資料集,涵蓋11個評分類別,SciBERT微調結合GPT-4合成資料、EASE及ALP,優於SMOTE過採樣。ALP等增強方法在嚴重不平衡類別達到完美精準率/召回率,並更貼近人類評分。
新論文介紹深度遞迴 Transformer(TRM 迭代),在 2/3 組合任務中展現強 OOD 泛化。中間監督促進啟發式而非真實推理,解釋基礎模型弱點。