
全新 LCLM 研究實現 16 倍 LLM 輸入壓縮且不犧牲準確度
研究人員推出了潛在上下文語言模型 (LCLMs),這是一種在解碼器處理前壓縮輸入 token 的編碼器-解碼器架構。此方法顯著減少了記憶體與運算瓶頸,效能優於傳統的 KV 快取壓縮技術。
Tag: #llm-efficiency12 results

研究人員推出了潛在上下文語言模型 (LCLMs),這是一種在解碼器處理前壓縮輸入 token 的編碼器-解碼器架構。此方法顯著減少了記憶體與運算瓶頸,效能優於傳統的 KV 快取壓縮技術。

Sapient 的研究人員開發了 HRM-Text,這是一種使用分層遞迴模型 (HRM) 取代標準 Transformer 的高效樣本模型。此方法使組織能夠以遠低於傳統大型語言模型的成本,從零開始預訓練具備推理能力的模型。

來自 UIUC 和 Stanford 的研究人員開發了 RecursiveMAS,這是一個允許代理透過嵌入空間而非文字進行通訊的框架。此方法將推論速度提升了 2.4 倍,並減少了 75% 的 Token 使用量。
新方法在長文本上實現32倍壓縮率,性能反超基準25個點,破解壓縮翻車難題。ICLR 2026收錄,強調優質壓縮非簡單刪減。

研究人員推出了混合專家擴散語言模型 DiffusionGemma-26B,其在醫學視覺問答任務中的表現與自回歸模型相當甚至更優。該模型提供了獨特的雙向填充功能,允許放射科醫師編輯報告片段,同時由 AI 填補中間內容。

PACT (Protocolized Action-state Communication and Transmission) 為多代理系統 (MAS) 引入了一種結構化的代理間通訊方法。透過將原始輸出轉換為精簡的動作狀態記錄,它能在維持或提升任務效能的同時,顯著降低 Token 使用量。

MSIFR 是一個無需訓練的新框架,可在生成過程中提早終止低質量的 LLM 輸出。透過在中間階段使用基於規則的驗證器,它能在不需額外訓練或架構變更的情況下,顯著減少 Token 的浪費。

HyEvo 是一個自動化工作流程生成框架,結合機率性 LLM 節點進行語義推理與確定性程式碼節點實現高效執行。它採用 LLM 驅動的多島嶼演化策略,透過 reflect-then-generate 機制依執行回饋優化混合工作流程。實驗顯示在推理與程式碼基準測試中超越現有方法,推理成本降低至多 19 倍、執行延遲降低 16 倍。

ModelBest 完成由中國電信領投的數億元融資。此舉標誌著公司與國家資訊基礎設施提供商展開戰略合作。合作旨在推進高效大模型開發。

國產通用大模型第一梯隊迎來新成員。開發策略正從單純的參數規模競爭,轉向關注「智能密度」與「Token價值」。