
讓離線強化學習從「局部描摹」變「全域佈局」丨ICLR’26
新方法將離線強化學習從局部模仿轉變為全域策略規劃。獲ICLR 2026錄取,從畫大綱轉向扣細節。此進展提升無即時互動的RL能力。
Tag: #iclr-20265 results

新方法將離線強化學習從局部模仿轉變為全域策略規劃。獲ICLR 2026錄取,從畫大綱轉向扣細節。此進展提升無即時互動的RL能力。

SEINT 提出一種無需訓練的 SE(p) 不變度量,用於 3D 點雲和高分子等結構數據。它將高維分布壓縮為一維等距不變表示(PTD/DcPTD),用於快速一維最優傳輸計算。實現嚴格度量性質,並具備近線性複雜度。

PIL 使用輕量線性代理而非 DNN 生成不可學習樣本,大幅降低計算成本。它利用擾動誘導深度模型線性行為的洞見。在 CIFAR/ImageNet 上提供相當保護效果與更高效率。
RaBitQ 論文作者公開澄清 TurboQuant 對其方法的描述不完整且不準確,包括理論保證和實證比較。他們強調遺漏如隨機旋轉等關鍵步驟,以及不當的次優聲明,儘管先前已通知。貼文旨在糾正本地 LLM 推論社群在 ICLR 2026 前夕的混淆。
一位社群成員在 ICLR 2026 的部落格文章中發現了潛在的技術錯誤,並正在尋求同儕驗證。儘管已嘗試聯繫作者與主辦單位,但目前尚未獲得回應。