CPD:長上下文 LLM 服務加速 40%
Together AI 的快取感知預填充-解碼分離(CPD)將溫熱預填充與冷解碼工作負載分離,以實現高效推理。它提供高達 40% 的更高吞吐量,並大幅降低首 token 時間。長提示現在能實現更快回應,而無延遲。
Tag: #long-context86 results
Together AI 的快取感知預填充-解碼分離(CPD)將溫熱預填充與冷解碼工作負載分離,以實現高效推理。它提供高達 40% 的更高吞吐量,並大幅降低首 token 時間。長提示現在能實現更快回應,而無延遲。

Unsloth 在 Hugging Face 發布 Qwen3.5-9B-GGUF,這是一款 9B 因果語言模型帶視覺編碼器。具備 Gated DeltaNet 等先進架構,並支援高達 100 萬 token 上下文長度。以多步驟 MTP 進行預訓練與後訓練。

MiniMax 回顧在 MiniMax-Text-01 中放棄混合注意力,因為在大規模多跳推理任務中出現明顯缺陷,儘管基準測試表現良好。新開源模型如 DeepSeek V3.2 和 Qwen3.5-397B-A17B 展示了高效長上下文全注意力。基準測試是洩漏抽象,隱藏了真實成本。

Inception Labs 推出 Mercury 2,這是一款基於擴散的巨型語言模型,專為高速多步驟推理任務設計。它具備 128K 上下文窗口,能夠處理複雜的推理能力。

MiniMax M2.5 發布後登頂 OpenRouter 熱度與調用榜,周調用量達 3.07T tokens,超過 Kimi K2.5 等對手總和。它帶動 100K-1M 長文本 Agent 工作流需求。模型權重全面開源,支持本地部署。

DeepSeek 從 2 月 13 日起在其網頁和 App 版本開始測試一款支援 100 萬 token 的新型長上下文模型。這引發業界對農曆新年重大發布的猜測,可能複製去年模型的爆紅成功。

Andrej Karpathy 正倡議將《魔戒》作為評估大型語言模型的新基準。這項提議可用於測試模型處理及推理長篇複雜敘事的能力。

一名自稱 Ant 員工的作者比較中國主要 AI 實驗室的策略:Qwen 強調分發、DeepSeek 著重架構、Moonshot 採取長期實驗,而 Ant 聚焦服務成本。貼文還將 Ling-3.0-flash 描述為總參數 124B、針對高效長上下文代理工作負載設計的模型,並表示權重將在公告後開放。

一位獨立研究人員推出了名為 DABSN 的新型循環語言模型架構,並正尋求合作夥伴進行擴展與獨立評估。該專案完全開源,並提供 PyTorch、C++ 與 Triton 的實作版本。

Apple 研究人員探討如何透過優化上下文互動程式的選擇,來提升遞迴語言模型 (RLMs) 的效能。該研究旨在解決語言模型在長文本場景中,難以可靠地提取與推理資訊的核心挑戰。