
Google 發表 DiffusionGemma,實現非序列式文字生成
Google 推出了實驗性的 26B MoE 模型 DiffusionGemma,利用擴散技術而非逐個 token 的方式進行平行文字生成。此方法透過同時處理整個文字區塊,實現了高達 4 倍的推論速度提升。
Tag: #llm-architecture16 results

Google 推出了實驗性的 26B MoE 模型 DiffusionGemma,利用擴散技術而非逐個 token 的方式進行平行文字生成。此方法透過同時處理整個文字區塊,實現了高達 4 倍的推論速度提升。

GraphRAG 透過知識圖譜連結分散的數據點,解決了傳統向量 RAG 的局限性。雖然它在處理全局查詢與複雜推理時表現優異,但相比單純的相似度搜尋,它需要更高的運算成本。

一位開發者成功利用identity-init層複製技術,將Gemma4-31B模型擴展至44B參數。該模型並針對韓語法律與STEM數據集進行微調,以測試容量擴展效果。

HDD-RoPE 是一種新的位置編碼技術,將序列位置視為多維度,允許更靈活的旋轉軸。與標準的 xPos Transformer 相比,它在 TinyStories 資料集上展現了更快的收斂速度。
富士通開發了一種名為 PHOTON 的新型 LLM 架構,能顯著提升 GPU 的處理吞吐量。此創新旨在減少運行大型語言模型所需的 GPU 數量,從而大幅降低營運成本。

總部位於邁阿密的 AI 新創公司 Subquadratic 結束隱身狀態,聲稱已解決大型語言模型中存在已久的數學瓶頸。儘管最初受到質疑,該公司目前正開始提供技術證據以支持其說法。

本文探討了企業環境中標準向量 RAG 的局限性,並提出了混合式「Graph RAG」架構。它強調在資料攝取過程中維護數據拓撲結構與關聯性,以提升 LLM 推理的準確性。

Apple 研究人員開發 ParaRNN,讓大型非線性 RNN 可平行訓練。此突破克服傳統 RNN 的順序計算限制,使數十億參數模型成為可能。它擴展了資源受限裝置上高效 LLM 的架構選擇。

提出決策中心框架,將LLM系統中的決策訊號與動作政策分離,使控制層明確且可檢查。這有助於將失敗歸因於特定元件,並實現模組化改進。實驗顯示減少無效動作、提升任務成功率,並揭示可解釋的失敗模式。

Elon Musk 點讚 Kimi 研究論文,挑戰大模型的核心基礎。它提出優雅的「旋轉」方法。此論文因潛在推進 LLM 架構而受矚目。