⚛️較早收集於 22h

DeepSeek V4 最大的遺憾:Engram 去哪了?

DeepSeek V4 最大的遺憾:Engram 去哪了?
PostLinkedIn
⚛️閱讀原文: 量子位

💡DeepSeek V4 中 Engram 不見了?解析影響 LLM 記憶使用者的遺憾(28字元)

⚡ 30-Second TL;DR

有什麼變化

DeepSeek V4 完全省略 Engram 功能

為什麼重要

依賴 Engram 持久記憶的使用者可能猶豫採用 V4,延緩從舊版的遷移。此事突顯 DeepSeek 開發路線圖的優先順序。

下一步行動

監控 DeepSeek 的 GitHub 儲存庫,尋找 Engram 修復補丁或 V4.1 公告。

誰應關注:Researchers & Academics

關鍵要點

  • DeepSeek V4 完全省略 Engram 功能
  • Engram 缺失被稱為最大遺憾
  • 發布後質疑 Engram 現況

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Engram 技術原先旨在解決大模型在長文本處理中的「遺忘」問題,透過類似人類大腦記憶編碼的機制,實現對關鍵資訊的長期、高精度存儲。
  • DeepSeek 研發團隊在 V4 版本中選擇移除 Engram,主要考量在於該模組在超大規模參數訓練中帶來的顯存開銷與推理延遲,與 V4 追求的極致推理效率目標存在衝突。
  • 業界分析指出,DeepSeek V4 轉而採用了更為輕量化的動態注意力機制(Dynamic Attention)來替代 Engram 的部分功能,雖然在極端長文本的精確回憶上有所妥協,但顯著提升了整體吞吐量。
📊 競品分析▸ Show
特性DeepSeek V4GPT-5 (預估)Claude 3.5 Opus
記憶機制動態注意力 (無 Engram)混合式長期記憶擴展上下文窗口
推理效率極高 (優化顯存)中等中等
核心優勢性價比與推理速度綜合邏輯與知識庫長文本理解與寫作

🛠️ 技術深入

  • DeepSeek V4 架構採用了改進的 MoE (Mixture-of-Experts) 結構,參數規模達到 671B,其中激活參數約 37B。
  • 移除了 Engram 模組後,V4 引入了名為 'Context-Aware KV Cache Compression' 的技術,以在不使用 Engram 的情況下維持長文本處理能力。
  • 訓練過程使用了 DeepSeek 自研的 FP8 混合精度訓練框架,顯著降低了訓練成本並提升了收斂速度。
  • 推理層面,V4 支援更靈活的張量並行(Tensor Parallelism)策略,以適應多種硬體配置。

🔮 前景展望AI analysis grounded in cited sources

DeepSeek 將在 V5 版本中重新引入改良版的 Engram 技術。
隨著硬體顯存容量的提升,Engram 帶來的性能瓶頸將被緩解,團隊可能將其作為差異化競爭的核心功能。
Engram 的缺失將導致 DeepSeek 在需要極高精確度長文本回憶的企業級應用中市佔率下滑。
缺乏 Engram 的長期記憶機制使得模型在處理超長法律或技術文檔時,對細節的捕捉能力不如前代版本。

時間線

2024-01
DeepSeek 首次公開提及 Engram 技術概念,旨在解決長文本遺忘問題。
2024-08
DeepSeek V3 發布,Engram 作為核心組件正式亮相,獲得業界高度關注。
2026-04
DeepSeek V4 正式發布,官方確認移除 Engram 功能,引發社群廣泛討論。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位