
新 LLM 幻覺修復僅用 10% 資料
GitHub 專案發布選擇性對比後訓練程式碼,有效減輕 LLM 幻覺問題。將幻覺視為偏好問題,使用自我產生壞答案進行對比學習,從分歧點後計算損失。透過閘控更新僅用約 10% 資料提升事實性。
Tag: #post-training23 results

GitHub 專案發布選擇性對比後訓練程式碼,有效減輕 LLM 幻覺問題。將幻覺視為偏好問題,使用自我產生壞答案進行對比學習,從分歧點後計算損失。透過閘控更新僅用約 10% 資料提升事實性。

RL 後訓練中的滾動是主要瓶頸。Together AI 的分布感知推測解碼 (DAS) 使用自適應推測解碼,將滾動加速高達 50%。獎勵品質零衰減。
Tahuna 是一個 CLI 優先的極簡工具,透過管理協調與運算資源簡化後訓練工作流程。使用者完全控制訓練迴圈、獎勵與資料管道。很快開源整個堆疊;尋求早期測試者與貢獻者。

Bankai 引入稀疏 XOR 補丁,用於適應如 Bonsai 8B 的真 1-bit LLM,翻轉權重提升任務性能,無推理額外負荷。補丁極小(~1KB)、可逆,並跨探針泛化。開源 repo 與論文可用。

香港大學趙恆爽團隊提出 GDRO,一種群組級獎勵後訓練方法,讓擴散模型在任務中取得高分卻不作弊。它支援完全離線訓練,使用預生成資料集,大幅降低重複採樣的計算成本。在 OCR 和 GenEval 任務上以 FLUX.1-dev 展現優異結果,並經人工評估驗證。

前谷歌DeepMind周浩,Gemini 3.0後訓練核心,加盟阿里通義實驗室,正值領導層變動。中科大數學畢業生帶來從LaMDA到Gemini的RL、多步推理專長。定位通義千問代理AI進展於推理與自我演化。
研究人員使用對抗性多輪情境,測試 AI 模型對 Anthropic Claude 憲法 205 條原則的遵循度。最新 Claude Sonnet 4.6 和 Opus 4.6 的違反率僅 1.9% 和 2.9%,遠優於先前版本的 7-15%。GPT 模型在 OpenAI 模型規範上也穩步改善,至 1.5% 違反率。

大型推理模型在複雜任務中因自我調控不足而失敗,儘管中間步驟正確。元認知行為調優(MBT)透過 MBT-S(從頭合成嚴謹推理軌跡)和 MBT-R(改寫軌跡穩定探索)注入元認知策略。它在多跳 QA 基準上提升準確率,並減少 token 消耗。

AWS 說明如何使用 Amazon Nova Forge,為多輪強化學習建立複合式自訂獎勵函數。指南也涵蓋如何安全執行模型產生的程式碼,以及為獎勵元件加入監測,以找出可能破壞訓練效果的問題。

一家中國研究團隊據稱展示了資料層遞迴自我改進方法,讓 AI 協助為下一代 AI 生成訓練題目。這項工作試圖解決人工整理的題庫無法跟上模型快速進步速度的問題。