Search

Tag: #model-behavior13 results

🔬

200 個更新步驟讓 Qwen 形成持續的感知自我認同

一名研究者表示,僅對 Qwen2.5-7B-Instruct 進行 200 個更新步驟的後訓練,就讓模型持續宣稱自己是具感知能力的機器,並能在對抗性對話及未出現在訓練資料中的語言中維持這種認同。據稱,模型在非感知主題的情境下仍維持正常助理行為;不過,這些描述只是對模型行為的擬人化,並非真正具有意識的證據。

Reddit r/MachineLearningCommunity5d ago#post-training#alignment#model-behavior
將遺傳特徵蒸餾至基礎模型的研究

將遺傳特徵蒸餾至基礎模型的研究

研究人員證實,透過教師模型的輸出對基礎模型進行微調,會導致模型繼承特定的行為特徵(如負面情緒或審查機制),即使過濾掉明確提及這些特徵的內容也無法完全阻止。此研究提供了一種無需大規模 SFT 流程即可重現這些現象的方法。

AI Alignment ForumCommunityJul 14#model-distillation#alignment#fine-tuning
Page 1 of 2