☁️AWS Machine Learning Blog•較早收集於 14m
在 Amazon SageMaker 上使用 P-EAGLE 進行平行推測解碼

💡了解如何透過 Amazon SageMaker 上的 P-EAGLE 平行推測解碼來降低 LLM 推論延遲。
⚡ 30-Second TL;DR
有什麼變化
將 P-EAGLE 整合至 SageMaker AI 以實現平行推測解碼。
為什麼重要
此整合透過優化推測解碼中的草稿生成過程,顯著降低了即時生成式 AI 應用程式的延遲。它降低了開發者在託管基礎設施上實作先進推論加速技術的門檻。
下一步行動
從 SageMaker JumpStart 部署一個相容模型並啟用 P-EAGLE,以針對您的特定 LLM 工作負載進行延遲改善基準測試。
誰應關注:Developers & AI Engineers
關鍵要點
- •將 P-EAGLE 整合至 SageMaker AI 以實現平行推測解碼。
- •支援透過 SageMaker JumpStart 進行模型選擇與配置。
- •可部署用於生成式 AI 應用程式的高度優化即時端點。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 14 個來源。
🔑 增強重點摘要
- •P-EAGLE 將 EAGLE 從自迴歸草稿生成轉變為平行草稿生成,透過在單次前向傳遞中產生 K 個草稿代幣,消除了生成草稿代幣的序列瓶頸,從而實現了顯著的加速。
- •P-EAGLE 在 NVIDIA B200 GPU 上,針對實際工作負載,比傳統 EAGLE-3 實現高達 1.69 倍的加速,在低併發性下吞吐量提高 55-69%,在高併發性下仍能維持 5-25% 的增益,並在編碼基準測試中比標準解碼快 4-5 倍。
- •P-EAGLE 已整合至 vLLM (v0.16.0+) 中,並由 AWS 貢獻給開源社群,其輕量級的 4 層草稿模型能夠平行預測多達 10 個代幣,並且比 EAGLE-3 更能從更深的推測深度中獲益。
- •Amazon SageMaker 的整合包括優化的生成式 AI 推論建議,該功能可根據效能目標(成本、延遲、吞吐量)自動選擇最佳部署配置,並使用 NVIDIA AIPerf 在實際 GPU 基礎設施上進行基準測試。
- •SageMaker AI 透過分析模型架構、縮小配置空間並應用推測解碼等優化技術,將部署時間從數週縮短至數小時,讓開發人員能專注於模型建構而非基礎設施調優。
🛠️ 技術深入
- P-EAGLE 透過可學習的共享隱藏狀態,將 EAGLE 從自迴歸多代幣預測轉換為平行多代幣預測。
- 它在單次前向傳遞中生成 K 個草稿代幣,解決了傳統 EAGLE 需要 K 次前向傳遞才能生成 K 個代幣的序列瓶頸。
- P-EAGLE 的架構包含兩個步驟:預填充(目標模型處理提示並生成新代幣)和 P-EAGLE 捕獲內部狀態以平行生成 K 個草稿代幣。
- 對於多代幣預測 (MTP) 位置(代幣 2 到 K),P-EAGLE 使用可學習的共享隱藏狀態 (
h_shared) 和遮罩代幣嵌入作為缺失隱藏向量和未知前一個代幣的佔位符。 - P-EAGLE 草稿模型是一個輕量級的 4 層模型,將解碼器層數從 1 層增加到 4 層可顯著提高接受長度。
- 它會解凍從目標模型繼承的代幣嵌入,因為遮罩代幣嵌入需要學習。
- P-EAGLE 的訓練涉及注意力遮罩預計算和序列分區技術,以實現梯度累積,從而能夠擴展到長上下文。
- 在 vLLM 中的實作利用融合的 Triton 核心,以最大程度地減少批次元資料重建的開銷。
🔮 前景展望AI analysis grounded in cited sources
生成式 AI 推論將變得更具成本效益且更容易存取。
P-EAGLE 的平行處理和 SageMaker 的優化建議降低了延遲並提高了吞吐量,直接減少了 LLM 部署所需的計算資源和成本。
更複雜的平行草稿機制將加速發展。
P-EAGLE 消除了序列瓶頸,允許探索更大的草稿架構和潛在更高的接受率,從而推動推測解碼的界限。
AI 開發人員將把重點從基礎設施優化轉移到模型開發和應用創新。
SageMaker 的自動化推論建議和優化端點抽象化了複雜的基礎設施調優,使開發人員能夠專注於構建準確的模型和面向用戶的應用程式。
⏳ 時間線
2022
Google Research 正式引入推測解碼技術。
2024-07
Amazon SageMaker 宣布推出新的生成式 AI 推論功能,支援推測解碼,可將吞吐量提高 2 倍,成本降低 50%。
2025-11
Amazon SageMaker AI 引入基於 EAGLE 的自適應推測解碼(EAGLE 2 和 EAGLE 3),將 LLM 推論吞吐量提高達 2.5 倍。
2026-02
關於「P-EAGLE:具有可擴展訓練的平行草稿 EAGLE」的 arXiv 論文發表。
2026-03
P-EAGLE 整合到 vLLM (v0.16.0+) 中,AWS 將 P-EAGLE 貢獻給 vLLM 主線。
2026-04
Amazon SageMaker AI 推出優化的生成式 AI 推論建議,利用 NVIDIA AIPerf。
📎 來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog ↗
每週 AI 簡報
每週一封,可隨時退訂。



