
全新 LCLM 研究實現 16 倍 LLM 輸入壓縮且不犧牲準確度
研究人員推出了潛在上下文語言模型 (LCLMs),這是一種在解碼器處理前壓縮輸入 token 的編碼器-解碼器架構。此方法顯著減少了記憶體與運算瓶頸,效能優於傳統的 KV 快取壓縮技術。
Tag: #model-optimization39 results

研究人員推出了潛在上下文語言模型 (LCLMs),這是一種在解碼器處理前壓縮輸入 token 的編碼器-解碼器架構。此方法顯著減少了記憶體與運算瓶頸,效能優於傳統的 KV 快取壓縮技術。

MiniMax 推出了 MiniMax Sparse Attention (MSA),這是一種支援原生 1M token 上下文視窗的架構。透過重組記憶體存取模式並避開標準的二次方複雜度,該架構實現了顯著的速度提升。
Fast-Slow Training (FST) 框架透過將模型參數作為「慢」權重、優化後的上下文作為「快」權重來優化 LLM。此方法提高了樣本效率,減少了災難性遺忘,並在持續學習過程中保持了模型的塑性。

Hugging Face 推出了專為邊緣運算環境優化的全新模型 Cosmos 3 Edge。此版本旨在於資源受限的環境中提供高效能的 AI 能力。

本文為 AI 產品經理提供了一份從手動評測工作流轉向系統化、自動化評測框架的全面指南。強調了定義明確指標、基於角色的評測以及迭代優化的重要性。

Apple 研究人員提出了一種優化機器學習「遺忘」的方法,透過識別並忽略對模型輸出影響微乎其微的數據點。此方法顯著降低了從訓練模型中移除特定數據時通常所需的計算開銷。
ExTernD 引入了一種創新的訓練後量化 (PTQ) 方法,將矩陣分解為兩個三元矩陣和一個對角縮放矩陣。這種方法允許任意大的內部秩,使三元 LLM 能夠達到與更高精度量化相當的準確度。

IMGNet 是一種新型人臉驗證模型,以滑動視窗符號模式匹配取代了傳統的餘弦相似度。該模型在 LFW 基準測試中表現優異,且模型大小僅為 10.58 MB。

作者介紹了原生因式分解權重(NFW),這是一種將 Transformer 層初始化為低秩矩陣以提高訓練效率和泛化能力的方法。研究發現存在一個由語料庫決定的最佳秩,這能有效防止模型過度記憶,並在參數更少的情況下超越稠密模型。

VideoFlexTok 引入了一種從粗到細的標記化方法,擺脫了僵化的 3D 網格表示。這種方法允許根據影片複雜度進行可變長度的標記化,從而提高效率與資訊保留能力。