來源較早收集於 25m

DeepSeek 啟動 100 億美元融資,目標直指 AGI

閱讀原文: The Next Web (TNW)
#agi#open-source#funding

DeepSeek 投入 100 億美元研發 AGI,可能重新定義開發者的開源生態。

30 秒速覽

有什麼變化

DeepSeek 將 AGI 作為其主要長期目標。

為什麼重要

此次融資標誌著開源 AI 競爭格局的重大轉變,可能對閉源實驗室的市場主導地位構成挑戰。

下一步行動

密切關注 DeepSeek 的 GitHub 儲存庫,獲取可能優化您訓練流程的最新模型架構。

誰應關注:Developers & AI Engineers

關鍵要點

  • DeepSeek 將 AGI 作為其主要長期目標。
  • 實驗室將優先投入前沿研究,而非追求營收。
  • DeepSeek 將持續致力於發布開源模型。
關鍵數字3 億450 億100 億600 萬

深度解析

背景與延伸:來自公開資料,非原文內容。引用 35 個來源。

增強重點摘要

  • DeepSeek 正在尋求至少 3 億美元的外部資金,目標公司估值約為 450 億美元(約 100 億美元),潛在投資者包括中國國家人工智慧產業投資基金、騰訊、IDG 資本和 Monolith Capital。
  • 這是 DeepSeek 首次進行外部融資,此前該公司完全由創辦人梁文鋒的量化對沖基金 High-Flyer Quant 自行出資。
  • DeepSeek 的模型以其卓越的成本效益而聞名,例如 DeepSeek-V3 據報導僅用 600 萬美元的訓練成本就達到了與 GPT-4 相當的性能,而 GPT-4 的成本約為 1 億美元,這對 AI 產業產生了顛覆性影響。
  • DeepSeek 採用自下而上的組織結構,為研究人員提供無限的計算資源,並優先考慮研究熱情而非資歷,主要從中國大學招募年輕人才。
  • DeepSeek 的 V4 系列模型除了支援 Nvidia 晶片外,還針對華為昇騰和寒武紀晶片進行了優化,這表明其在中國國內市場的戰略重點,以應對美國的出口管制。

競品分析

DeepSeek
開源狀態
開源/開權重
架構特點
MoE (混合專家), MLA (多頭潛在注意力)
關鍵優勢
高效率推理、強大推理與編碼能力、長上下文處理
成本效益 (推論)
極高 (例如,R1 比 OpenAI 便宜 96%)
OpenAI (ChatGPT/GPT-4)
開源狀態
閉源
架構特點
密集型 Transformer
關鍵優勢
廣泛功能、強大編碼、多模態、成熟生態系統
成本效益 (推論)
較高
Anthropic (Claude)
開源狀態
閉源
架構特點
Transformer
關鍵優勢
強大推理、長上下文處理、內建安全功能
成本效益 (推論)
中等
Google (Gemini)
開源狀態
閉源 (API 可用)
架構特點
多模態 Transformer
關鍵優勢
多模態理解、與 Google 生態系統深度整合、代理能力
成本效益 (推論)
中等
Meta (Llama)
開源狀態
開權重
架構特點
密集型 Transformer
關鍵優勢
靈活的開源基礎設施、高度可客製化
成本效益 (推論)
中等
Mistral AI
開源狀態
開源
架構特點
MoE (部分模型)
關鍵優勢
高效率、可客製化、多樣化模型產品
成本效益 (推論)
Alibaba (Qwen)
開源狀態
開源
架構特點
Transformer
關鍵優勢
多語言能力、強大編碼和數學能力
成本效益 (推論)

技術深入

  • 混合專家 (MoE) 架構: DeepSeek-V2、V3 和 V4 系列模型均採用 MoE 架構,將模型劃分為專業的「專家」子網路。每個 token 僅激活總參數的一小部分,例如 V2 總參數 2360 億,每 token 激活 210 億;V3 總參數 6710 億,每 token 激活 370 億;V4-Pro 總參數 1.6 兆,每 token 激活 490 億。這顯著降低了計算成本,同時保持了高性能。
  • 多頭潛在注意力 (MLA): DeepSeek-V2 引入並在後續模型中沿用,這是一種新穎的注意力機制,通過低秩鍵值聯合壓縮顯著減少 KV 快取需求(例如 V2 減少 93.3%),從而實現高效推論並支援長達 128K token 的上下文視窗。
  • DeepSeekMoE: 一種高效的 MoE 架構,包含路由專家和共享專家。DeepSeek-V3 的每個 MoE 層包含 1 個共享專家和 256 個路由專家,每個 token 激活 8 個路由專家。它還具有無輔助損失的負載平衡機制。
  • 訓練效率: DeepSeek-V2 相較於 DeepSeek 67B 節省了 42.5% 的訓練成本。DeepSeek-V3 僅使用 280 萬 GPU 小時就達到了與 LLaMA 3 相當或更優的性能,而 LLaMA 3 則需要 3000 萬 GPU 小時。
  • 多 token 預測 (MTP): DeepSeek-V3 採用 MTP 技術,通過順序預測未來 token 來提高訓練效率,同時保持因果鏈。
  • 硬體優化: DeepSeek 的 V4 模型系列除了支援 Nvidia 外,還針對華為昇騰和寒武紀晶片進行了優化,以適應中國國內的硬體生態系統。

前景展望基於引用來源的 AI 分析

DeepSeek 的開源、高成本效益的 AGI 追求將加劇全球 AI 競爭,並加速高效模型架構的創新。
DeepSeek 通過以更低的成本展示高性能並開源其創新,促使其他實驗室採用類似的效率方法並分享研究成果,從而促進更具競爭力和協作性的 AI 開發格局。
接受外部資金可能會在未來引入商業壓力,從而微妙地影響 DeepSeek 純粹的研究重點。
儘管梁文鋒強調 AGI 優於營收,但接受來自騰訊和國家支持基金等投資者的外部資本,最終可能會導致對商業回報或戰略調整的期望。
DeepSeek 對中國國內硬體(華為昇騰、寒武紀)的優化將增強中國在 AI 基礎設施方面的自給自足能力。
這種戰略性的硬體兼容性降低了對美國晶片的依賴,減輕了出口管制的影響,並在中國培育了強大的國內 AI 生態系統。

時間線

2023-07
DeepSeek 成立,由梁文鋒創立,並由其對沖基金 High-Flyer 提供資金。
2023-11
DeepSeek LLM 系列模型發布,包括 7B 和 67B 參數版本,並採用開源策略。
2024-05
DeepSeek-V2 發布,引入 MoE 架構和 Multi-head Latent Attention (MLA),顯著提升訓練和推論效率。
2024-12
DeepSeek-V3 發布,擁有 6710 億總參數和 370 億激活參數,並在性能上與 Claude 3.5 和 GPT-4o 媲美,同時訓練成本更低。
2025-01
DeepSeek-R1 推理模型發布,其性能與 OpenAI 的頂級模型相當,但訓練成本顯著降低,並推出同名聊天機器人。
2026-04
DeepSeek-V4-Pro (1.6 兆參數) 和 DeepSeek-V4-Flash (2840 億參數) 模型發布,並優化支援華為昇騰和寒武紀晶片。

來源 (35)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

1investing.comvertexaisearch.cloud.google.com2thenextweb.comvertexaisearch.cloud.google.com3biggo.comvertexaisearch.cloud.google.com4phemex.comvertexaisearch.cloud.google.com5techfundingnews.comvertexaisearch.cloud.google.com6chinatalk.mediavertexaisearch.cloud.google.com7reddit.comvertexaisearch.cloud.google.com8pbs.orgvertexaisearch.cloud.google.com9wikipedia.orgvertexaisearch.cloud.google.com10digitalocean.comvertexaisearch.cloud.google.com11fintechweekly.comvertexaisearch.cloud.google.com12g2.comvertexaisearch.cloud.google.com13emergent.shvertexaisearch.cloud.google.com14sintra.aivertexaisearch.cloud.google.com15planetbanatt.netvertexaisearch.cloud.google.com16spectrumailab.comvertexaisearch.cloud.google.com17o-mega.aivertexaisearch.cloud.google.com18milvus.iovertexaisearch.cloud.google.com19chat-deep.aivertexaisearch.cloud.google.com20medium.comvertexaisearch.cloud.google.com21milvus.iovertexaisearch.cloud.google.com22gopenai.comvertexaisearch.cloud.google.com23github.comvertexaisearch.cloud.google.com24huggingface.covertexaisearch.cloud.google.com25medium.comvertexaisearch.cloud.google.com26chipstrat.comvertexaisearch.cloud.google.com27bentoml.comvertexaisearch.cloud.google.com28nvidia.comvertexaisearch.cloud.google.com29medium.comvertexaisearch.cloud.google.com30github.iovertexaisearch.cloud.google.com31github.comvertexaisearch.cloud.google.com32issarice.comvertexaisearch.cloud.google.com33scmp.comvertexaisearch.cloud.google.com34mindstudio.aivertexaisearch.cloud.google.com35huggingface.covertexaisearch.cloud.google.com

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: The Next Web (TNW)

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。