超越聊天機器人的 Direct Preference Optimization
本研究探討了 Direct Preference Optimization (DPO) 在標準對話式 AI 模型之外的應用。研究檢視了如何將偏好對齊技術調整應用於更多樣化的任務與架構中。
Tag: #fine-tuning102 results
本研究探討了 Direct Preference Optimization (DPO) 在標準對話式 AI 模型之外的應用。研究檢視了如何將偏好對齊技術調整應用於更多樣化的任務與架構中。

本指南探討了微調 Amazon Nova Forge 模型以提升特定領域效能的策略。內容涵蓋了關鍵的配置參數以及在訓練過程中應避免的常見錯誤。

本教學展示如何整合 Pulse AI 的文件理解能力與 Amazon Bedrock,構建可擴展的金融文件處理流程。重點在於透過專業的提取技術與模型微調,實現企業級的處理準確度。
Hugging Face 部落格展示在 AMD ROCm 平台上微調 MedQA,這是醫療問答的臨床 AI 模型。此方法無需 NVIDIA 的 CUDA,可在 AMD GPU 上進行訓練。強調 AI 開發的開源替代方案。

這篇 AWS 機器學習部落格文章探討使用 RLAIF 或 RL with LLM-as-a-judge 的強化微調。它深入說明此技術如何在 Amazon Nova 模型上有效運作。
.png)
Together AI 與 Adaption 合作,將 Together Fine-Tuning 原生整合至 Adaptive Data。此合作讓團隊能優化資料集、執行微調、評估結果,並部署更強大的開源模型,實現無縫工作流程。

本文介紹兩種微調 Amazon Nova Micro 以產生自訂 SQL 方言的方法。透過 Amazon Bedrock 隨選推論,實現成本效益與生產就緒效能。適合建置高效資料庫查詢工具。
使用 GRPO 在 3 台 Mac Mini 上訓練 Qwen2.5-0.5B-Instruct 的 Reddit 貼文摘要變體,具長度限制。品質 + 長度懲罰在 DeepEval 的 LLM-as-a-Judge 評估中優於僅長度(2.5/4 對 2.4/4),涵蓋忠實度、覆蓋率、簡潔性、清晰度。在 200 個 smoltldr 測試樣本上 ROUGE-L 複合分數顯著 p=0.0042。

AgentGate 是針對新興代理網際網路的輕量級結構化路由引擎,解決延遲、隱私和成本限制下的高效調度問題。它將路由分解為動作決策(單代理、多代理等)和結構化 grounding 階段。使用候選感知監督微調的 3B-7B 緊湊模型,在新基準上展現競爭力表現。

研究人員推出 VERT,一種用於評估多模態與解剖結構放射報告的穩健 LLM 指標。它優於 RadFact、GREEN 和 FineRadScore,提升與專家評分的相關性達 11.7%。使用 1,300 樣本微調 Qwen3 30B 可獲 25% 提升,並加速推理 37 倍。