🔥較早收集於 12m

TorchAO 擴展邊緣 LLM 的 QAT

TorchAO 擴展邊緣 LLM 的 QAT
PostLinkedIn
🔥閱讀原文: PyTorch Blog
#quantization#qat#edge-deploymenttorchaotorchaopytorchexecutorch

💡解鎖 TorchAO 擴展 QAT,實現邊緣設備上的緊湊 LLM。(38字)

⚡ 30-Second TL;DR

有什麼變化

TorchAO 中針對 LLM 的 QAT 流程擴展

為什麼重要

這實現了邊緣硬體上更高效的 LLM 部署,減少行動與 IoT AI 應用中的模型大小與推論延遲。

下一步行動

在 PyTorch 中試驗 TorchAO 的擴展 QAT,以最佳化您的 LLM 進行 ExecuTorch 邊緣匯出。

誰應關注:Developers & AI Engineers

關鍵要點

  • TorchAO 中針對 LLM 的 QAT 流程擴展
  • 透過 ExecuTorch 運行時針對邊緣設備
  • 建立於先前 PyTorch 部落格 QAT 介紹

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • TorchAO 的 QAT 支援 int8 per-token 動態激活 (8da) 與 int4 grouped per-channel 權重 (4w),可透過 prepare 和 convert API 應用於線性層[1][3]
  • QAT 在 Llama3-8B 上恢復高達 96% 的 Hellaswag 準確度損失與 68% 的 Wikitext 困惑度損失,相較於 PTQ[3]
  • TorchAO QAT 已整合至 torchtune 進行微調,以及 Unsloth 支援全參數與 LoRA 微調[3][4]
  • 初始實作採用模組替換方式,未來計畫遷移至 tensor subclasses 以提升與其他 PyTorch 功能的相容性[1]

🛠️ 技術深入

  • QAT 使用 fake quantization 模擬 int8 動態 per-token 激活與 int4 per-channel 權重量化,在訓練期間於 forward pass 中插入假量化模組[1][3][5]
  • prepare 步驟轉換模型線性層以模擬量化數值,convert 步驟將其轉為實際低位寬模組,可直接用於推理[3]
  • 支援 ExecuTorch 邊緣部署,針對 Llama2-7B 提供優於 GPTQ PTQ 的準確度[1][4]
  • 與 TorchTune 整合提供端到端微調與 QAT 流程,動機來自邊緣後端核心可用性與 LLM 量化研究[1][3]

🔮 前景展望AI analysis grounded in cited sources

邊緣 LLM 部署準確度將大幅提升
QAT 透過訓練時模擬量化錯誤,恢復 PTQ 的大部分準確度損失,使資源受限設備能運行高性能 LLM[3][5]
PyTorch 生態系量化工具將更完整
TorchAO 成為 PyTorch 原生 AO 庫,整合 ExecuTorch、TorchTune 與 Unsloth,提供從訓練到邊緣部署的統一流程[1][3][4]
int4 LLM 推理速度提升 1.89 倍
Llama-3-8B int4 量化結合 QAT 實現顯著推理加速與 58% 記憶體節省,適用於邊緣設備[4]

時間線

2024-06
TorchAO 原型 QAT 初始支援 8da4w 量化
2024-07
QAT 在 Llama-3-8B 上恢復 96% 量化準確度損失
2024-09
TorchAO 正式發布
2024-10
QAT 整合 Unsloth 支援 LoRA 微調
2025-01
TorchAO 與 torchtune 端到端 QAT 流程發布
2026-03
TorchAO 擴展 ExecuTorch 邊緣 LLM QAT 支援
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: PyTorch Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。