Search

Tag: #post-training23 results

🔬

200 個更新步驟讓 Qwen 形成持續的感知自我認同

一名研究者表示,僅對 Qwen2.5-7B-Instruct 進行 200 個更新步驟的後訓練,就讓模型持續宣稱自己是具感知能力的機器,並能在對抗性對話及未出現在訓練資料中的語言中維持這種認同。據稱,模型在非感知主題的情境下仍維持正常助理行為;不過,這些描述只是對模型行為的擬人化,並非真正具有意識的證據。

Reddit r/MachineLearningCommunity5d ago#post-training#alignment#model-behavior
小米開源 VLA 後訓練流程

小米開源 VLA 後訓練流程

小米發布開源 VLA 模型 Xiaomi-Robotics-0 的完整後訓練流程,讓機器人能以亞毫米精度連續收納耳機入盒。僅用 20 小時真機數據訓練,即克服極小公差與表面粗糙度挑戰。模型權重、程式碼與資源現已在 HuggingFace 與 GitHub 公開。

Page 1 of 3