🤖較早收集於 13m

ASURA:解鎖遞迴語言模型潛力

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#recursive-models#language-efficiency#flop-optimizationasuraasurauniversal-transformerstrmctm

💡簡單技巧讓遞迴 LM 在 FLOPs 上超越 GPT 等級基準—效率革命。(48字)

⚡ 30-Second TL;DR

有什麼變化

簡單技巧讓 RLM 超越同 FLOPs 基準

為什麼重要

重振遞迴架構,用於高效、可擴展語言模型,可能降低生產 LLMs 的運算成本。

下一步行動

查看 ASURA 部落格 https://neel04.github.io/my-website/projects/asura/ 以獲取實作技巧。

誰應關注:Researchers & Academics

關鍵要點

  • 簡單技巧讓 RLM 超越同 FLOPs 基準
  • 基於 TRM/CTM/UT 實現大幅效能提升
  • 針對語言建模超越靜態玩具領域
  • 解釋先前 RLM 表現不佳原因

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • RLM透過程式化方式檢查、分解提示,並遞迴呼叫自身子模型,處理超出模型上下文視窗兩倍以上的輸入。
  • 作者在小規模上後訓練首個原生遞迴模型RLM-Qwen3-8B,在四項長上下文任務平均超越基礎Qwen3-8B模型28.3%。
  • RLM在OOLONG-Pairs基準測試中得分23/100,而其他代理得0,證實其處理資訊密集型任務能力。
  • Prime Intellect實現RLM變體於驗證器環境,證實其提升長上下文與工具密集任務效能,並預期RL訓練將帶來進一步改進。

🛠️ 技術深入

  • RLM將長提示視為外部環境,讓LLM透過互動式程式碼環境(REPL)操控上下文,預載特定變數與函數。
  • 子LLM呼叫可平行化,主模型僅透過環境變數提供答案,支持Python REPL及其他工具使用。
  • 在DeepDive環境中,RLM幾乎使效能加倍,並大幅提升主模型token效率,驗證上下文壓縮效果。
  • 作者開發OOLONG-Pairs基準,測試長上下文對散佈陳述對的推理,模擬大規模事實矛盾識別等二次方難題。

🔮 前景展望AI analysis grounded in cited sources

透過RL訓練教導模型端到端管理上下文將是下一個重大突破
Prime Intellect研究顯示,當前RLM架構已證實有用,但RL訓練可釋放上下文折疊與效能潛力。
RLM將使AI代理解決需數週或數月之長任務
研究者觀察到RLM透過子模型協調與迭代修正,提升複雜長任務效能,雖耗時較長但保持主AI記憶清晰。

時間線

2025-12
arXiv發布Recursive Language Models論文v1,由Alex L. Zhang等人提出RLM架構
2026-01
論文修訂為v2,介紹RLM-Qwen3-8B模型並公布程式碼
2026-02
Prime Intellect部落格發表RLM實現與實驗結果,稱其為2026範式
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。