☁️較早收集於 12m

Amazon Nova 強化微調解析

Amazon Nova 強化微調解析
PostLinkedIn
☁️閱讀原文: AWS Machine Learning Blog
#fine-tuning#agentic-workflowsamazon-novaamazon-novaamazon-bedrocknova-forge

💡掌握 RFT 打造反饋驅動的 Nova 模型,超越模仿式微調 (24字)

⚡ 30-Second TL;DR

有什麼變化

RFT 透過評估反饋學習,而非模仿

為什麼重要

RFT 讓開發者打造更適應特定任務的 AI 模型,可能減少代理工作流程中的幻覺。這提升 AWS 上生產 AI 應用的效率,提供客製化競爭優勢。

下一步行動

使用樣本偏好資料集在 Amazon Bedrock 上測試 RFT 以應用於您的 LLM 任務。

誰應關注:Developers & AI Engineers

關鍵要點

  • RFT 透過評估反饋學習,而非模仿
  • 適合程式碼生成與客戶服務應用
  • 支援 Amazon Bedrock 託管服務與 Nova Forge 工作流程
  • 提供資料準備與獎勵函數指南
  • 比較 RFT 與監督微調的使用情境

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 10 個來源。

🔑 增強重點摘要

  • Amazon Bedrock 上的 RFT 在基礎模型上實現了平均 66% 的準確度提升,使較小的模型(如 Nova 2 Lite)能夠達到較大模型的性能水準[3]
  • RFT 支援使用 LLM 作為評判者的獎勵函數,能夠評估語義等價性和連貫性等難以程式化定義的複雜特性,無需大規模人工標註[1]
  • Nova Forge 作為付費訂閱服務提供進階功能,包括多輪對話支援、超過 15 分鐘的獎勵函數執行時間,以及自訂訓練配方修改,專為企業客戶設計[1]
  • Amazon Bedrock 的 RFT 完全託管端到端的強化學習流程,開發者無需建構 RL 管道或管理 GPU,僅需指定獎勵函數和撰寫提示[3]
  • RFT 在 Amazon Bedrock 上的最大提示限制為 20,000 個,而標準 RFT 的獎勵函數執行時間限制為 15 分鐘[1][6]

🛠️ 技術深入

  • 獎勵函數可透過 AWS Lambda 執行以計算客觀分數,或透過主控台選擇模型作為評判者,主控台會自動將準則轉換為 Lambda 函數[6]
  • RFT 的限制包括:Lambda 逾時 15 分鐘、僅支援單輪對話、需要足夠的資料多樣性(稀疏獎勵時表現不佳,正例少於 5%)、計算成本高於監督微調、不支援多模態資料[1]
  • Amazon Nova 2.0 相比 1.0 在推理能力、多語言支援、編碼和工具使用等複雜任務上有改進,並具有更好的長文本處理能力[2]
  • 監督微調 (SFT) 需要數千到數萬個示範,資料品質、一致性和多樣性比原始數量更重要;可混合 Nova 預訓練資料(10%-75%)以平衡任務特定性能和通用性能[4][5]
  • RFT 適用於複雜分析任務、數學問題解決和多步邏輯推導;簡單事實查詢應使用低或無推理模式以優化成本和延遲[1]

🔮 前景展望AI analysis grounded in cited sources

RFT 將使小型模型成為成本效益最優的選擇
66% 的準確度提升使 Nova 2 Lite 等較小模型能夠匹配或超越未微調的大型模型,推動推理成本和延遲的大幅降低[3]
多輪對話支援將擴展 RFT 在複雜應用中的適用性
Nova Forge 的多輪對話功能將使 RFT 能夠應用於客戶服務和互動式系統,超越目前的單輪限制[1]
LLM 評判者將減少對人工標註的依賴
使用 LLM 作為獎勵函數評估語義等價性和主觀品質,使組織能夠在無需大規模標註的情況下擴展 RFT 至複雜領域[1]

時間線

2024-12
Amazon Bedrock 推出 RFT 功能,初期支援 Amazon Nova 2 Lite
2025-Q1
Amazon Nova Forge 作為付費訂閱服務推出,提供進階 RFT 功能和多輪對話支援
2025-Q2
Amazon Nova 2.0 發布,相比 1.0 提升推理能力、多語言支援和複雜任務性能
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。