🐯較早收集於 8m

DeepSeek 的成功:效率優先於規模

PostLinkedIn
🐯閱讀原文: 虎嗅

💡了解 DeepSeek 如何無視「越大越好」的炒作,將推理成本削減至行業標準的十分之一。

⚡ 30-Second TL;DR

有什麼變化

DeepSeek 優先考慮推理效率,將成本降低至 OpenAI V4 的十分之一。

為什麼重要

DeepSeek 的模式證明了優化推理成本是顛覆市場的可行路徑,挑戰了資本密集型的「更大模型」範式。

下一步行動

評估您當前的 LLM 推理成本與性能比,並考慮在成本敏感的生產任務中測試 DeepSeek 的開源權重模型。

誰應關注:Developers & AI Engineers

關鍵要點

  • DeepSeek 優先考慮推理效率,將成本降低至 OpenAI V4 的十分之一。
  • 公司避開了「越大越好」的陷阱,專注於邊際成本而非邊際性能。
  • 成功源於獨立的判斷力,而非盲目跟隨矽谷的主流敘事。

🧠 深度解析

Web-grounded analysis with 43 cited sources.

🔑 增強重點摘要

  • DeepSeek 的模型,特別是 DeepSeek-V2 和 DeepSeek-V3,採用了專家混合 (MoE) 架構並結合多頭潛在注意力 (MLA),以在推理時僅激活顯著較少的參數,從而實現高效能,同時大幅降低計算開銷和鍵值 (KV) 緩存需求。
  • DeepSeek 已發布多個專用模型,例如 DeepSeek-Coder(用於編程)和 DeepSeek-Math(用於數學推理),這些模型在其各自領域展現了最先進的性能,在特定任務中常超越大型通用模型或與 GPT-4 Turbo 等閉源替代方案競爭。
  • 該公司獨特的資金模式,由中國對沖基金 High-Flyer 擁有和資助,使其能夠在沒有外部風險投資者即時壓力的情況下,追求長期的 AI 研究與開發,這有助於其顛覆性的發展策略。
  • DeepSeek 的開源策略,包括在寬鬆許可證(例如 MIT 許可證)下發布模型權重,促進了快速採用和大量衍生模型的產生,挑戰了專有模型的主導地位,並在 AI 市場中引發了價格戰。
  • DeepSeek 之所以能實現成本效益,部分歸因於利用現成商用 (COTS) 硬體、優化訓練流程(例如,從預訓練直接到人類回饋強化學習,跳過監督式微調階段),以及採用先進的知識蒸餾技術。
📊 競品分析▸ Show
特性/模型DeepSeek-V2DeepSeek-V3DeepSeek-Coder-V2OpenAI GPT-4oMeta Llama 3 70BQwen 2.5 72B
架構MoE (236B總參數, 21B激活)MoE (671B總參數, 37B激活)MoE (236B總參數, 21B激活)閉源密集型密集型
上下文長度128K tokens未公開 (基於V2架構)128K tokens未公開8K tokens未公開
輸入價格 (每百萬tokens)$0.14未公開 (API價格具競爭力)未公開 (API價格具競爭力)$3.00N/A (開源,自託管)N/A (開源,自託管)
輸出價格 (每百萬tokens)$0.28未公開未公開$10.00N/AN/A
主要優勢/基準訓練成本降低42.5%,KV緩存減少93.3%,生成吞吐量提高5.76倍 (相較DeepSeek 67B);通用基準表現強勁資源效率高 (2.8M GPU小時 vs Llama 3的30M);發布時性能可與Claude 3.5和GPT-4o媲美代碼生成能力與GPT-4 Turbo媲美;支持338種編程語言;HumanEval超越GPT-3.5-Turbo多模態能力強,通用性能領先通用性能強,開源生態系統龐大中文支持強,編碼能力領先開源模型

🛠️ 技術深入

  • 架構: 採用專家混合 (MoE) 架構,特別是 DeepSeekMoE,並結合多頭潛在注意力 (MLA) 機制。
  • MoE 細節: DeepSeekMoE 採用細粒度專家分割和共享專家隔離策略。DeepSeek-V2 總參數為 2360 億,每個 token 激活 210 億參數。DeepSeek-V3 總參數為 6710 億,每個 token 激活 370 億參數。
  • 注意力機制: Multi-head Latent Attention (MLA) 用於減少鍵值 (KV) 緩存需求,提高推理效率。
  • 訓練: 模型在龐大數據集上進行預訓練(例如,DeepSeek-V2 在 8.1 萬億 tokens 上預訓練,DeepSeek-Coder-V2 額外增加了 6 萬億 tokens)。訓練過程包括監督式微調 (SFT) 和強化學習 (RL)。
  • 精度: DeepSeek-V3/R1 在訓練中採用 FP8 混合精度,這在開源大型語言模型中是一種創新方法。
  • 上下文長度: DeepSeek-V2 支持高達 128K tokens 的上下文長度。DeepSeek-Coder-V2 將上下文長度從 16K 擴展到 128K。
  • 專用模型: DeepSeek-Coder 專為編程設計,在 87% 代碼和 13% 自然語言(共 2 萬億 tokens)上訓練,具有 16K 的上下文窗口。DeepSeek-Math 是一個基於 Transformer 的數學專用模型,採用思維鏈提示 (chain-of-thought prompting) 技術,並在大量數學問題和競賽級別問題上進行訓練。DeepSeek-R1 是一個推理模型,據稱訓練成本僅為 600 萬美元,性能可與 GPT-4 媲美。

🔮 前景展望AI analysis grounded in cited sources

DeepSeek 的效率優先和開源策略將加速基礎大型語言模型能力的商品化。
透過以顯著更低的成本提供高效能模型並將其開源,DeepSeek 迫使競爭對手降低價格,並鼓勵更廣泛的採用和創新,使先進 AI 更具可及性。
DeepSeek 的成功將加劇全球 AI 開發的競爭,特別是來自非西方公司的競爭。
DeepSeek 儘管面臨晶片限制,仍能與老牌西方 AI 實驗室競爭甚至超越,這表明創新可以在傳統矽谷敘事之外蓬勃發展,從而促進更多元化的全球 AI 格局。
DeepSeek 的專用 MoE 架構將成為開發高效能和領域特定 AI 模型的新標準。
DeepSeek 的 MoE 和 MLA 在降低推理成本和提高編碼、數學等任務性能方面的實證有效性,可能會導致業界更廣泛地採用和進一步研究類似的稀疏激活和注意力機制。

時間線

2023-07
DeepSeek 公司成立,由對沖基金 High-Flyer 創始人梁文鋒創立並資助。
2023-11
DeepSeek LLM 7B/67B 模型發布,在英語和中文的 2 萬億 tokens 數據集上從頭開始訓練。
2024-05
DeepSeek-V2 模型發布,引入 MoE 和 Multi-head Latent Attention (MLA) 架構,總參數 2360 億,激活參數 210 億,上下文長度達 128K。
2024-12
DeepSeek-V3 模型發布,總參數 6710 億,激活參數 370 億,並在發布時性能可與 Claude 3.5 和 GPT-4o 媲美。
2025-01
DeepSeek-R1 模型及其聊天機器人應用發布,迅速成為美國 Apple App Store 下載量第一的免費應用。
2025-06
DeepSeek-Coder-V2 發布,一個開源 MoE 代碼語言模型,在代碼任務上性能可與 GPT-4 Turbo 媲美。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅