32倍壓縮率下性能反超25個點!破解長文本壓縮「翻車」難題 | ICLR 2026
新方法在長文本上實現32倍壓縮率,性能反超基準25個點,破解壓縮翻車難題。ICLR 2026收錄,強調優質壓縮非簡單刪減。
Tag: #long-context85 results
新方法在長文本上實現32倍壓縮率,性能反超基準25個點,破解壓縮翻車難題。ICLR 2026收錄,強調優質壓縮非簡單刪減。

英偉達 Blackwell Ultra 在 DeepSeek-R1 模型測試中,每兆瓦吞吐量較 Hopper 提升 50 倍,百萬 tokens 成本降至 35 分之一。預告 Rubin 平台將再提升 10 倍。主要關鍵為 130 TB/s NVLink 和 NVFP4 精度格式。
這篇討論提出,應將 Transformer 的 KV Cache 視為具備可導航性的高維向量空間,而非扁平陣列。如此一來便能建立索引並執行局部注意力,降低推論時每一步掃描全部歷史內容的需求。
一名研究人員批評某些評估做法,指出這些做法可能讓稀疏注意力與 KV cache 壓縮方法看起來比實際更有效。文章點出簡單的檢索任務、不對等的基準調校、有利提示詞,以及實作上的優勢,都可能扭曲比較結果。
一項 DNA 序列建模實驗指出,Linear Attention 在百萬 token 上下文的 Needle-in-a-Haystack 檢索任務中表現不佳,經常接近 25% 的隨機基線。HyenaDNA 的測試也出現類似結果,凸顯壓縮狀態表示是否從根本上限制可靠長距離回憶的問題。

DeepSeek 的 API 文件現已列出 deepseek-v4-pro,版本為 DeepSeek-V4-Pro-0813,並支援 Responses API 與工具呼叫。該模型提供 100 萬 token 上下文視窗、最高 384,000 token 輸出,以及每百萬個快取命中輸入 token 0.003625 美元的價格。

DeepSeek 已在其 API 平台推出 DeepSeek-V4-Pro-0813。該模型結合百萬 Token 上下文視窗與明確的代理開發工具,價格為 Flash 版本的三倍。

ANT Group 的 Ling 3.0 Tiny 現已透過 Vercel AI Gateway 提供,免費使用至 8 月 13 日。這款混合專家模型主打反應迅速的代理程式、指令遵循與多輪對話。

研究人員推出了首個具備邊行動邊糾錯能力的 Agentic 擴散模型。該模型實現了 128K 的上下文視窗,在長程任務表現上追平了自回歸模型。

Long-Horizon-Terminal-Bench 引入了一套新的 AI 代理評估框架,包含 46 項需要長期規劃與迭代除錯的複雜多步驟任務。該基準測試透過提供密集的中間獎勵,能比傳統僅評估最終結果的方法更精確地衡量代理在開放式工作流程中的進展。