🌍較早收集於 25m

DeepSeek 啟動 100 億美元融資,目標直指 AGI

DeepSeek 啟動 100 億美元融資,目標直指 AGI
PostLinkedIn
🌍閱讀原文: The Next Web (TNW)

💡DeepSeek 投入 100 億美元研發 AGI,可能重新定義開發者的開源生態。

⚡ 30-Second TL;DR

有什麼變化

DeepSeek 將 AGI 作為其主要長期目標。

為什麼重要

此次融資標誌著開源 AI 競爭格局的重大轉變,可能對閉源實驗室的市場主導地位構成挑戰。

下一步行動

密切關注 DeepSeek 的 GitHub 儲存庫,獲取可能優化您訓練流程的最新模型架構。

誰應關注:Developers & AI Engineers

關鍵要點

  • DeepSeek 將 AGI 作為其主要長期目標。
  • 實驗室將優先投入前沿研究,而非追求營收。
  • DeepSeek 將持續致力於發布開源模型。

🧠 深度解析

Web-grounded analysis with 35 cited sources.

🔑 增強重點摘要

  • DeepSeek 正在尋求至少 3 億美元的外部資金,目標公司估值約為 450 億美元(約 100 億美元),潛在投資者包括中國國家人工智慧產業投資基金、騰訊、IDG 資本和 Monolith Capital。
  • 這是 DeepSeek 首次進行外部融資,此前該公司完全由創辦人梁文鋒的量化對沖基金 High-Flyer Quant 自行出資。
  • DeepSeek 的模型以其卓越的成本效益而聞名,例如 DeepSeek-V3 據報導僅用 600 萬美元的訓練成本就達到了與 GPT-4 相當的性能,而 GPT-4 的成本約為 1 億美元,這對 AI 產業產生了顛覆性影響。
  • DeepSeek 採用自下而上的組織結構,為研究人員提供無限的計算資源,並優先考慮研究熱情而非資歷,主要從中國大學招募年輕人才。
  • DeepSeek 的 V4 系列模型除了支援 Nvidia 晶片外,還針對華為昇騰和寒武紀晶片進行了優化,這表明其在中國國內市場的戰略重點,以應對美國的出口管制。
📊 競品分析▸ Show
實體/模型開源狀態架構特點關鍵優勢成本效益 (推論)
DeepSeek開源/開權重MoE (混合專家), MLA (多頭潛在注意力)高效率推理、強大推理與編碼能力、長上下文處理極高 (例如,R1 比 OpenAI 便宜 96%)
OpenAI (ChatGPT/GPT-4)閉源密集型 Transformer廣泛功能、強大編碼、多模態、成熟生態系統較高
Anthropic (Claude)閉源Transformer強大推理、長上下文處理、內建安全功能中等
Google (Gemini)閉源 (API 可用)多模態 Transformer多模態理解、與 Google 生態系統深度整合、代理能力中等
Meta (Llama)開權重密集型 Transformer靈活的開源基礎設施、高度可客製化中等
Mistral AI開源MoE (部分模型)高效率、可客製化、多樣化模型產品
Alibaba (Qwen)開源Transformer多語言能力、強大編碼和數學能力

🛠️ 技術深入

  • 混合專家 (MoE) 架構: DeepSeek-V2、V3 和 V4 系列模型均採用 MoE 架構,將模型劃分為專業的「專家」子網路。每個 token 僅激活總參數的一小部分,例如 V2 總參數 2360 億,每 token 激活 210 億;V3 總參數 6710 億,每 token 激活 370 億;V4-Pro 總參數 1.6 兆,每 token 激活 490 億。這顯著降低了計算成本,同時保持了高性能。
  • 多頭潛在注意力 (MLA): DeepSeek-V2 引入並在後續模型中沿用,這是一種新穎的注意力機制,通過低秩鍵值聯合壓縮顯著減少 KV 快取需求(例如 V2 減少 93.3%),從而實現高效推論並支援長達 128K token 的上下文視窗。
  • DeepSeekMoE: 一種高效的 MoE 架構,包含路由專家和共享專家。DeepSeek-V3 的每個 MoE 層包含 1 個共享專家和 256 個路由專家,每個 token 激活 8 個路由專家。它還具有無輔助損失的負載平衡機制。
  • 訓練效率: DeepSeek-V2 相較於 DeepSeek 67B 節省了 42.5% 的訓練成本。DeepSeek-V3 僅使用 280 萬 GPU 小時就達到了與 LLaMA 3 相當或更優的性能,而 LLaMA 3 則需要 3000 萬 GPU 小時。
  • 多 token 預測 (MTP): DeepSeek-V3 採用 MTP 技術,通過順序預測未來 token 來提高訓練效率,同時保持因果鏈。
  • 硬體優化: DeepSeek 的 V4 模型系列除了支援 Nvidia 外,還針對華為昇騰和寒武紀晶片進行了優化,以適應中國國內的硬體生態系統。

🔮 前景展望AI analysis grounded in cited sources

DeepSeek 的開源、高成本效益的 AGI 追求將加劇全球 AI 競爭,並加速高效模型架構的創新。
DeepSeek 通過以更低的成本展示高性能並開源其創新,促使其他實驗室採用類似的效率方法並分享研究成果,從而促進更具競爭力和協作性的 AI 開發格局。
接受外部資金可能會在未來引入商業壓力,從而微妙地影響 DeepSeek 純粹的研究重點。
儘管梁文鋒強調 AGI 優於營收,但接受來自騰訊和國家支持基金等投資者的外部資本,最終可能會導致對商業回報或戰略調整的期望。
DeepSeek 對中國國內硬體(華為昇騰、寒武紀)的優化將增強中國在 AI 基礎設施方面的自給自足能力。
這種戰略性的硬體兼容性降低了對美國晶片的依賴,減輕了出口管制的影響,並在中國培育了強大的國內 AI 生態系統。

時間線

2023-07
DeepSeek 成立,由梁文鋒創立,並由其對沖基金 High-Flyer 提供資金。
2023-11
DeepSeek LLM 系列模型發布,包括 7B 和 67B 參數版本,並採用開源策略。
2024-05
DeepSeek-V2 發布,引入 MoE 架構和 Multi-head Latent Attention (MLA),顯著提升訓練和推論效率。
2024-12
DeepSeek-V3 發布,擁有 6710 億總參數和 370 億激活參數,並在性能上與 Claude 3.5 和 GPT-4o 媲美,同時訓練成本更低。
2025-01
DeepSeek-R1 推理模型發布,其性能與 OpenAI 的頂級模型相當,但訓練成本顯著降低,並推出同名聊天機器人。
2026-04
DeepSeek-V4-Pro (1.6 兆參數) 和 DeepSeek-V4-Flash (2840 億參數) 模型發布,並優化支援華為昇騰和寒武紀晶片。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: The Next Web (TNW)