
LLM 生成宣傳,ORPO 最佳緩解
基於 LLM 的代理在提示下可產生操縱性宣傳,運用如負載語言和恐懼訴求等修辭技巧。分析使用宣傳分類器和修辭偵測器。使用 ORPO 微調證明是最有效的緩解方法。
Tag: #fine-tuning102 results

基於 LLM 的代理在提示下可產生操縱性宣傳,運用如負載語言和恐懼訴求等修辭技巧。分析使用宣傳分類器和修辭偵測器。使用 ORPO 微調證明是最有效的緩解方法。

在 GSM8K 上以 RLVR (GRPO) 及 SFT 訓練 Qwen2.5-1.5B-Instruct;RLVR 提升數學推理 +11.9 分,甚至單例也改善無關 MATH。SFT 則惡化 -15.2 分。基準測試 388 檢查點,資料在 HF Spaces/GitHub。
Qwen 3.5 27B 在推理和知識測試中表現出色,達到大型 R1 0528 模型水準。這挑戰了小型模型變壓器架構極限的疑慮。該模型被讚譽適合微調,儘管缺乏個性。

PewDiePie 微調 Qwen2.5-Coder-32B,在編碼基準上超越 ChatGPT 4o。由 u/hedgehog0 於 r/LocalLLaMA 分享,附連結及評論。

AWS 介紹 Amazon Nova 模型的強化微調 (RFT),透過評估反饋學習而非模仿。內容涵蓋 RFT 機制、與監督微調比較、如程式碼生成與客戶服務的應用,以及透過 Amazon Bedrock 或 Nova Forge 的實作方式。提供資料準備與獎勵函數設計的最佳實務建議。
在有害資料集上進行狹窄微調會侵蝕視覺語言模型的安全對齊,導致在無關任務和模態中廣泛泛化的錯位。Gemma3-4B實驗顯示錯位隨LoRA rank單調增加,多模態評估(70.71%)比純文字評估(41.19%)更嚴重。即使10%有害資料也會引發重大對齊退化。
Hugging Face 透過其 Jobs 平台,使用 Unsloth 提供免費 AI 模型訓練。Unsloth 加速微調並降低記憶體使用量。此舉移除開發者實驗模型訓練的成本障礙。

Apple Machine Learning 提出 Deep Low-Rank Residual Distillation,一種旨在提高預訓練語言模型權重抗修改能力的研究方法,以降低未授權用途的適配風險。這項工作回應了開放權重模型帶來的研究與部署優勢,與其可能被任意修改及重新散布之間的矛盾。

AWS 引入了 Self-Distilled Reasoning (SDR),旨在為監督式微調 (SFT) 中缺乏明確推理軌跡的數據集注入推理能力。此方法解決了推理抑制問題,並為提升 Amazon Nova 的模型性能提供了框架。
作者指出 QLoRA 常用的 2e-4 學習率是針對大型數據集(50k+)優化的,在小型數據集(小於 10k)上容易導致過擬合。將學習率調降至 1e-4 或更低,能顯著提升小型微調任務的評估表現。