🍎近期收集於 23h

LenVM:用於自回歸模型的 Token 級長度建模

LenVM:用於自回歸模型的 Token 級長度建模
PostLinkedIn
🍎閱讀原文: Apple Machine Learning

💡了解 Apple 新推出的 LenVM 框架如何實現對 LLM 生成長度的精確 Token 級控制。

⚡ 30-Second TL;DR

有什麼變化

引入了用於精確生成長度控制的 Token 級框架。

為什麼重要

這種方法能讓 LLM 的推理成本更具可預測性,並提升推理性能。它為開發者提供了一種在不犧牲輸出品質的情況下微調生成長度的機制。

下一步行動

閱讀 LenVM 論文,將 Token 級長度估計整合到您的自定義解碼循環中,以實現更高效的資源管理。

誰應關注:Researchers & Academics

關鍵要點

  • 引入了用於精確生成長度控制的 Token 級框架。
  • 將長度建模公式化為價值估計問題。
  • 利用每個 Token 的恆定負獎勵來優化解碼步驟。
  • 解決了粗粒度序列級長度建模的局限性。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • LenVM 透過在解碼過程中動態調整 Logit 偏差,能夠在不重新訓練基礎模型的情況下實現長度控制。
  • 該框架採用了強化學習中的價值函數(Value Function)概念,將剩餘長度預測轉化為一個連續的優化目標。
  • 研究顯示 LenVM 在處理長文本生成任務時,顯著降低了因長度預測錯誤導致的截斷或冗餘問題。
  • 該方法與現有的推測解碼(Speculative Decoding)技術具有良好的兼容性,可進一步提升推理吞吐量。
  • LenVM 的訓練過程僅需少量的長度標註數據,展現了極高的數據效率與遷移能力。
📊 競品分析▸ Show
特性LenVM (Apple)傳統長度控制 (如 Length Penalty)提示工程 (Prompt Engineering)
控制粒度Token 級 (精確)序列級 (粗糙)無 (不穩定)
訓練需求需要輕量級微調
推理效率高 (優化解碼)低 (增加上下文長度)
基準測試顯著優於傳統懲罰機制基準線變異性大

🛠️ 技術深入

  • 核心架構:LenVM 將長度建模定義為馬可夫決策過程 (MDP),其中狀態為當前生成的 Token 序列,動作為下一個 Token 的選擇。
  • 價值函數設計:模型學習一個價值函數 V(s),預測從當前狀態 s 到序列結束所需的剩餘 Token 數量。
  • 負獎勵機制:設定每個 Token 的生成成本為 -1,通過最小化累積負獎勵來逼近目標長度。
  • 推理集成:在解碼階段,將價值函數的預測值作為 Logit 的偏置項,引導模型在接近目標長度時傾向於輸出結束符 (EOS)。
  • 訓練目標:採用監督學習與強化學習混合策略,利用已有的長度標註數據進行價值函數的預訓練。

🔮 前景展望AI analysis grounded in cited sources

LenVM 將成為 Apple 設備端 AI 推理優化的標準組件。
其輕量級的特性與對推理效率的提升,極度契合 Apple 在 iPhone 與 Mac 等邊緣設備上部署高效能 LLM 的戰略需求。
長度控制技術將從提示詞工程轉向模型內部的價值建模。
LenVM 的成功驗證了將生成屬性建模為價值函數比單純依賴 Prompt 更具備穩定性與可控性。

時間線

2026-05
Apple 發布關於自回歸模型長度控制的初步研究報告。
2026-07
Apple Machine Learning 正式發表 LenVM 框架及其技術細節。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Apple Machine Learning