Search

Tag: #transformers19 results

🔬

ResBM:管線訓練 128 倍壓縮

Macrocosmos 論文推出 ResBM,一種用於低頻寬管線並行訓練的 transformer 架構,實現 SOTA 128 倍激活壓縮。具備跨階段殘差編碼器-解碼器瓶頸,保留低階身份路徑。針對去中心化/網際網路級訓練,使用 Muon 測試。

Reddit r/MachineLearningCommunityApr 16#distributed-training#transformers
權重範數裁剪加速 Grokking 18-66 倍

權重範數裁剪加速 Grokking 18-66 倍

獨立研究者開發權重範數裁剪,在優化器步驟後對解碼器權重施加逐行 L2 裁剪,在模運算 grokking 基準上實現 2 層模型 66 倍加速、8 層模型 18 倍加速,對比基線無一失敗達 300 種子。程式碼與 PDF 在 GitHub 上;大型 LLM 測試進行中。

Reddit r/MachineLearningCommunityMar 17#grokking#weight-clipping#transformers
在 NVIDIA cuTile 中調優 Flash Attention 達峰值效能

在 NVIDIA cuTile 中調優 Flash Attention 達峰值效能

NVIDIA 開發者部落格詳細說明使用 cuTile Python 實作 Flash Attention,這是現代 AI 的關鍵工作負載,以達峰值效能。它涵蓋透過 quickstart 文件的環境設定,以及 transformer 模型核心的 attention 機制。從業者可學習優化 token 處理的技巧。

NVIDIA Developer BlogOfficialMar 4#transformers#cuda
資料增強解決AI科學解釋評分類別不平衡

資料增強解決AI科學解釋評分類別不平衡

這篇ArXiv論文探討Transformer模型的資料增強策略,用以解決NGSS科學解釋AI評分中的類別不平衡問題。使用1,466個學生回應的資料集,涵蓋11個評分類別,SciBERT微調結合GPT-4合成資料、EASE及ALP,優於SMOTE過採樣。ALP等增強方法在嚴重不平衡類別達到完美精準率/召回率,並更貼近人類評分。

Page 1 of 2