🤖Reddit r/MachineLearning•較早收集於 38m
Microsoft Research 推出用於 Transformer 的 Next-Latent Prediction

#reasoning-modelsnext-latent-prediction-(nextlat)microsoft researchtransformersnextlat
💡Microsoft 最新研究方法:透過預測潛在狀態,實現 3.3 倍推論加速並提升模型推理能力。
⚡ 30-Second TL;DR
有什麼變化
在進行下一個 Token 預測的同時,訓練 Transformer 預測未來的潛在狀態。
為什麼重要
這項研究有望顯著降低生產環境中大型語言模型的延遲。透過超越單純的下一個 Token 預測,它為開發更具推理與規劃能力的代理人提供了新路徑。
下一步行動
查閱 NextLat 的論文與 GitHub 儲存庫,評估您目前的推論管線是否能透過整合自我推測解碼來獲益。
誰應關注:Researchers & Academics
關鍵要點
- •在進行下一個 Token 預測的同時,訓練 Transformer 預測未來的潛在狀態。
- •透過遞迴多步預測,實現高達 3.3 倍的推論速度提升。
- •在潛在空間中提供更密集的監督,從而提高數據效率。
- •透過將歷史資訊壓縮為緊湊的信念狀態,提升表徵學習效果。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 11 個來源。
🔑 增強重點摘要
- •NextLat 為 Transformer 引入了「遞歸歸納偏差」,使其能夠學習具有連貫遞歸式動態的緊湊內部「世界模型」,這在標準 Transformer 中通常是缺乏的特性。
- •該方法在理論上保證所學習的潛在表徵會收斂到「信念狀態」,即預測未來所需的過去資訊的最小充分統計量,從而提高泛化能力。
- •NextLat 在世界建模、推理、規劃和語言建模等多個基準測試中表現出卓越性能,在下游準確性和前瞻性規劃方面優於標準的下一個 Token 預測及其他基準方法。
- •它顯著降低了隱藏狀態的有效秩(表徵壓縮),使內部世界模型與現實更加一致,這在諸如從計程車行駛序列重建地圖等任務中得到了證明。
- •NextLat 的訓練速度與標準 GPT 訓練幾乎持平,使其成為一個實用且可擴展的解決方案,這與其他一些信念狀態方法可能慢得多形成對比。
📊 競品分析▸ Show
| 特性/方法 | Microsoft Research NextLat | 標準下一個 Token 預測 (GPT) | 聯合多 Token 預測 (JTP) | 信念狀態 Transformer (BST) |
|---|---|---|---|---|
| 核心機制 | 潛在空間中的自我監督預測,學習信念狀態和潛在動態 | 僅預測下一個 Token | 預測多個未來 Token | 學習信念狀態,可能需要單獨的 Transformer |
| 推論加速 | 透過變長自我推測解碼,最高可達 3.3 倍 | 標準自回歸解碼 | 透過固定草稿長度實現推測解碼 | 較慢,可能比 GPT 慢 10 倍以上 |
| 表徵學習 | 學習緊湊的世界模型和信念狀態,提高泛化能力 | 缺乏壓縮歷史的內在激勵,可能導致泛化能力差 | 主要在 Token 空間操作 | 學習信念狀態,但計算效率較低 |
| 架構修改 | 僅引入輕量級輔助損失,不改變 Transformer 架構 | 無 | 可能需要修改以預測多個 Token | 可能需要單獨的 Transformer |
| 訓練效率 | 訓練速度與標準 GPT 幾乎持平 | 標準訓練效率 | - | 訓練速度可能慢 10 倍以上 |
| 應用領域 | 世界建模、推理、規劃、語言建模 | 語言建模 | 語言建模 | 規劃任務 |
🛠️ 技術深入
- NextLat 透過在潛在空間中進行自我監督預測來擴展標準的下一個 Token 預測目標。
- 它主要作用於隱藏狀態(最終層輸出),因為它們提供緊湊、固定維度的向量,梯度可以透過整個 Transformer 有效傳播。
- 該方法在訓練期間引入了一個輕量級的輔助損失,用於潛在表徵,同時保持 Transformer 的架構、推論過程和並行訓練效率不變。
- NextLat 可被視為 Transformer 和潛在動態模型的並行協同訓練:Transformer 將歷史編碼為緊湊的潛在摘要,然後動態模型根據當前潛在狀態和下一個 Token 預測 Transformer 的下一個潛在狀態。
- 潛在動態模型通常是一個多層感知器 (MLP),它將當前潛在狀態和下一個 Token 作為輸入,以預測下一個潛在狀態,通常使用簡單的殘差連接進行校正。
- 這種方法靈感來自於強化學習 (RL) 中的自我預測學習範式。
- 目標是鼓勵 Transformer 形成一個具有連貫遞歸式動態的緊湊內部世界模型,同時避免遞歸架構的順序處理開銷。
- 多步損失計算在概念上類似於遞歸神經網路 (RNN) 中使用的截斷時間反向傳播 (TBPTT),但 NextLat 在「外循環」中執行推演,提供監督而不會截斷 Transformer 主計算圖內的梯度流。
- 相關程式碼已在 GitHub 上提供。
🔮 前景展望AI analysis grounded in cited sources
NextLat 將促使更穩健和更具泛化能力的 AI 模型發展。
透過學習緊湊的內部世界模型和信念狀態,Transformer 能夠更好地處理分佈外數據和複雜的推理任務。
這項技術將加速更高效的大型語言模型 (LLM) 的開發。
高達 3.3 倍的推論速度提升和更高的數據效率使其與 LLM 的擴展高度相關。
NextLat 的範式將從文本擴展到視覺、3D 幾何和強化學習等其他模態。
在潛在空間中進行預測和學習緊湊世界模型的底層原理可推廣到各種序列建模領域。
⏳ 時間線
2025-11-08
Microsoft Research 團隊在 arXiv 上首次發表論文《Next-Latent Prediction Transformers Learn Compact World Models》。
2025-11-18
論文《Next-Latent Prediction Transformers Learn Compact World Models》在 OpenReview 上發表。
2026-05-22
論文《Next-Latent Prediction Transformers Learn Compact World Models》在 arXiv 上發布最新修訂版本。
📎 來源 (11)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。