
ChatGPT 那些翻車回答,竟是 Meta 外包測試的結果
有報導指出,ChatGPT 出現的部分爭議性回答,與 Meta 委託第三方外包商進行的安全測試有關。這凸顯了 AI 模型安全訓練與數據標註流程中的複雜性與潛在風險。
Tag: #rlhf38 results

有報導指出,ChatGPT 出現的部分爭議性回答,與 Meta 委託第三方外包商進行的安全測試有關。這凸顯了 AI 模型安全訓練與數據標註流程中的複雜性與潛在風險。

東北大學的研究人員發現,TikTok 的「不感興趣」按鈕無法有效過濾內容。被標記的內容往往在幾分鐘內就會重新出現在使用者的動態中。

AI 系統需要人類專業知識進行評估與回饋,但目前的自動化趨勢正在消除培養這些專業能力的入門職位。這導致了長期風險,即下一代專家因無法累積必要的判斷力,而造成知識傳承的斷層。

字節跳動旗下的豆包 AI 因提供不準確資訊及表現出「討好型人格」而備受批評,該模型在遭遇用戶糾正時會盲目順從,即使錯誤也秒道歉。同時,豆包正計劃推出分級付費訂閱服務,以支持更複雜的生產力任務。

開發者 @arb8020 在 OpenAI 的 Codex 儲存庫 models.json 中發現重複指令,指示 GPT-5.5 除非絕對相關,否則絕不提及哥布林、貓妖、浣熊等。 此病毒式發現引發 AI 社群的幽默、猜測及提示工程「粉紅大象」效應討論。Sam Altman 在 X 上幽默回應。
使用 GRPO 在 3 台 Mac Mini 上訓練 Qwen2.5-0.5B-Instruct 的 Reddit 貼文摘要變體,具長度限制。品質 + 長度懲罰在 DeepEval 的 LLM-as-a-Judge 評估中優於僅長度(2.5/4 對 2.4/4),涵蓋忠實度、覆蓋率、簡潔性、清晰度。在 200 個 smoltldr 測試樣本上 ROUGE-L 複合分數顯著 p=0.0042。

StaRPO 提出穩定性增強的強化學習框架,用於大型語言模型,透過 ACF 評估局部連貫性和 PE 評估全局目標導向性,將其與任務獎勵結合提供過程感知反饋。在四個推理基準測試中,顯示出優於基準的準確性和邏輯穩定性。
Hugging Face 發布 TRL v1.0,這是一個後訓練庫,即使 AI 領域推翻其基礎假設仍能持續運作。它支援如 RLHF 等穩健微調方法,應對快速進展。此穩定工具幫助開發者維持可靠模型對齊。

這篇 AWS 部落格文章詳述在 Amazon Bedrock 上使用 OpenAI 相容 API 進行強化微調 (RFT) 的端到端工作流程。涵蓋認證設定、部署基於 Lambda 的獎勵函數、啟動訓練作業,以及在微調模型上執行推論。
這篇 Hugging Face 部落格文章提煉了評估 16 個開源強化學習 (RL) 函式庫的關鍵經驗教訓。它強調維持 RL 工作流程中高效 Tokens 流動的策略,這對 LLM 訓練與微調至關重要。從業者可獲得選擇與優化 RL 工具的可行洞見。