☁️AWS Machine Learning Blog•較早收集於 4m
利用 Amazon SageMaker AI 的 SFT 與 DPO 提升代理工具呼叫準確度

💡學習如何在 SageMaker 上使用 SFT 與 DPO,讓您的 AI 代理在呼叫外部工具時更加可靠。
⚡ 30-Second TL;DR
有什麼變化
結合 SFT 與 DPO 以優化 SLM 在工具呼叫任務上的表現。
為什麼重要
此方法能協助開發者減少模型幻覺並提升函數呼叫的精確度,進而在資源受限的環境中打造更可靠的 AI 代理。
下一步行動
請依照教學步驟,使用您自己的工具呼叫資料集設定 SageMaker 訓練任務,以基準測試 DPO 相較於標準 SFT 的效能提升。
誰應關注:Developers & AI Engineers
關鍵要點
- •結合 SFT 與 DPO 以優化 SLM 在工具呼叫任務上的表現。
- •利用 Amazon SageMaker AI 訓練任務來減輕基礎設施管理負擔。
- •實作系統化的評估方法,比較基礎模型與微調後的模型差異。
- •專注於以數據為導向的決策,提升模型品質。
🧠 深度解析
Web-grounded analysis with 24 cited sources.
🔑 增強重點摘要
- •監督式微調 (SFT) 透過訓練模型遵循指令和基本能力來建立強大的初始策略,而直接偏好優化 (DPO) 則透過精煉細微偏好和糾正細緻行為來穩定訓練並防止過度擬合,兩者結合能有效提升模型性能。
- •針對特定工具呼叫領域進行微調後,小型語言模型 (SLM) 在準確度上可與大型語言模型 (LLM) 媲美甚至超越,同時顯著降低運行延遲和成本,使其成為生產環境中代理工作流程的實用選擇。
- •DPO 透過直接優化模型以偏好成對的偏好數據,簡化了模型對齊過程,無需單獨的獎勵模型或複雜的強化學習程序(如 RLHF),從而減少了資源需求和訓練時間。
- •對於 SFT 而言,數據集的品質(準確性、多樣性、複雜性)比數量更為關鍵;一個經過精心策劃的較小數據集,其性能往往優於一個龐大但嘈雜的數據集。
- •Amazon SageMaker AI 不僅支援 SFT 和 DPO,還支援多種模型家族(如 Amazon Nova、GPT-OSS、Llama、Qwen 和 DeepSeek)以及其他微調技術,例如可驗證獎勵強化學習 (RLVR) 和來自 AI 反饋的強化學習 (RLAIF),並整合 MLflow 進行指標追蹤。
📊 競品分析▸ Show
| 平台/服務 | 特點 | 定價模式 | 基準/性能 (工具呼叫) |
|---|---|---|---|
| Amazon SageMaker AI | 端到端託管 ML 平台,支援 SFT、DPO、RLVR、RLAIF、分散式訓練、多種 GPU 實例 (P4d, P5),提供 MLOps 功能 (管道、模型監控、特徵商店)、Jupyter Notebooks、SageMaker Studio、JumpStart (預訓練模型)、無伺服器客製化。 | 按需付費 (按秒計費運算,按 GB 計費儲存),可選擇 ML 儲蓄計劃 (最高 64% 折扣)。成本因實例類型和持續時間而異。託管 Spot 訓練可節省高達 90%。 | 微調後的 SLM (Qwen3 1.7B & 4B 結合 GRPO/RLVR) 在金融 API 上達到 0.96 的精確匹配和 0.95 的模式準確度,超越 GPT-OSS-120B 並與其 10-70 倍大小的模型表現相當。 |
| Google Cloud Vertex AI | 端到端 ML 工具,與 TensorFlow、TFX、BigQuery 緊密整合,強大的 AutoML 和預訓練模型,託管 Notebooks、管道、可擴展的模型部署端點,MLOps 工具 (模型註冊、監控、版本控制)。 | 基於使用量和模組化計費 (分別為運算、儲存、訓練和預測服務付費)。 | 缺乏針對 SFT/DPO 工具呼叫的具體基準數據。 |
| Amazon Bedrock | 更偏向精靈式、API 驅動的微調方法。抽象化基礎設施。主要支援供應商專有模型,部分開源模型 (主要為 Llama) 可微調。與 SageMaker 相比,對底層基礎設施的控制較少。 | 基於 API 使用量計費,抽象化基礎設施成本。 | 缺乏針對 SFT/DPO 工具呼叫的具體基準數據。 |
🛠️ 技術深入
- 監督式微調 (SFT):
- 使用高品質的指令-響應對來訓練基礎模型,以學習對話的格式、語氣和結構。
- 透過最小化響應的負對數似然值(使用交叉熵損失)來學習預測正確的響應。
- 僅使用響應標記進行損失計算。
- 可採用全量微調、低秩適應 (LoRA) 或量化低秩適應 (QLoRA) 等方法提高效率。
- 對於教授基本指令遵循、自定義響應結構/語氣、生成特定格式以及在不嵌入詳細工具指令的情況下啟用工具/API 使用至關重要。
- 直接偏好優化 (DPO):
- 使用人類偏好數據(一對被判斷為更好和更差的響應)進一步精煉 SFT 模型。
- 透過最小化對比損失(通常是獎勵差異上的交叉熵損失),學習為正向響應分配比負向響應更高的機率。
- 直接優化模型以偏好某些輸出,無需單獨的獎勵模型或複雜的強化學習程序,如 RLHF。
- 適用於主觀品質任務、調整語氣/身份、安全對齊,並因其對比性質而通常比 SFT 更好地提升能力。
- 數據集需要 (提示、選擇的響應、拒絕的響應) 三元組。
- 通常在 SFT 之後使用,以建立穩健的初始策略並穩定訓練。
- AI 代理中的工具呼叫:
- 涉及 AI 模型理解用戶意圖、判斷是否需要工具、選擇正確的工具、傳遞結構化參數、執行工具並解釋結果。
- 對於透過利用外部資源(API、資料庫、外部工具)執行複雜任務、實現動態決策和即時數據處理至關重要。
- 微調 (SFT 和 DPO) 教導 SLM 針對特定領域工具的確切模式、參數格式和錯誤處理邏輯。
- Amazon SageMaker AI 基礎設施:
- 完全託管服務,負責資源配置、擴展、安全性、加密、分散式訓練協調和資源清理。
- 支援 Hugging Face Transformers 庫的各種參數高效微調方法(例如 LoRA、FSDP)。
- 提供優化的運算和儲存配置,以降低訓練成本並提高 GPU 利用率。
- 提供託管的 Jupyter Notebook 實例和帶有 SDK(Python、JavaScript、Ruby、Java 和 Go)的 Web API。
- 整合 MLflow 以追蹤訓練和驗證指標。
🔮 前景展望AI analysis grounded in cited sources
企業將加速採用小型語言模型 (SLM) 於生產環境中的代理應用。
由於微調後的 SLM 在工具呼叫任務上能達到與大型語言模型 (LLM) 相當甚至超越的準確度,同時顯著降低延遲和成本,這將使其成為企業級代理工作流程的更具吸引力且可行的選擇。
AI 代理的工具呼叫能力將變得更加複雜和自主。
隨著 SFT 和 DPO 等微調技術的進步,以及對可驗證獎勵強化學習 (RLVR) 等方法的整合,AI 代理將能夠更精確地判斷何時呼叫工具、如何格式化參數,並在多步驟任務中進行更複雜的推理。
對高品質、策劃過的訓練數據集的需求將持續增長。
無論是 SFT 的指令響應對還是 DPO 的偏好數據對,數據集的質量而非數量被證明是模型性能的關鍵決定因素,這將推動對數據策劃和合成數據生成技術的投資。
⏳ 時間線
2017-11
Amazon SageMaker 於 AWS re:Invent 大會上發布,作為一個端到端的託管機器學習服務。
2019
SageMaker Studio (ML IDE) 和 Autopilot (AutoML) 推出,增強了平台的功能。
2020
SageMaker 推出 JumpStart,提供預訓練模型,簡化模型開發。
2023
Meta AI 推出 Toolformer,展示了 LLM 自主呼叫外部工具的能力,預示了代理 AI 的發展。
2024-12
AWS 宣布下一代 Amazon SageMaker,將現有服務更名為 Amazon SageMaker AI,並推出 SageMaker Unified Studio (預覽版)。
2025-12
Amazon SageMaker AI 宣布新的無伺服器客製化功能,可與多種 AI 模型介接,並支援 SFT、DPO 等微調技術。
📎 來源 (24)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog ↗


