🌍The Next Web (TNW)•較早收集於 25m
DeepSeek 啟動 100 億美元融資,目標直指 AGI

💡DeepSeek 投入 100 億美元研發 AGI,可能重新定義開發者的開源生態。
⚡ 30-Second TL;DR
有什麼變化
DeepSeek 將 AGI 作為其主要長期目標。
為什麼重要
此次融資標誌著開源 AI 競爭格局的重大轉變,可能對閉源實驗室的市場主導地位構成挑戰。
下一步行動
密切關注 DeepSeek 的 GitHub 儲存庫,獲取可能優化您訓練流程的最新模型架構。
誰應關注:Developers & AI Engineers
關鍵要點
- •DeepSeek 將 AGI 作為其主要長期目標。
- •實驗室將優先投入前沿研究,而非追求營收。
- •DeepSeek 將持續致力於發布開源模型。
🧠 深度解析
Web-grounded analysis with 35 cited sources.
🔑 增強重點摘要
- •DeepSeek 正在尋求至少 3 億美元的外部資金,目標公司估值約為 450 億美元(約 100 億美元),潛在投資者包括中國國家人工智慧產業投資基金、騰訊、IDG 資本和 Monolith Capital。
- •這是 DeepSeek 首次進行外部融資,此前該公司完全由創辦人梁文鋒的量化對沖基金 High-Flyer Quant 自行出資。
- •DeepSeek 的模型以其卓越的成本效益而聞名,例如 DeepSeek-V3 據報導僅用 600 萬美元的訓練成本就達到了與 GPT-4 相當的性能,而 GPT-4 的成本約為 1 億美元,這對 AI 產業產生了顛覆性影響。
- •DeepSeek 採用自下而上的組織結構,為研究人員提供無限的計算資源,並優先考慮研究熱情而非資歷,主要從中國大學招募年輕人才。
- •DeepSeek 的 V4 系列模型除了支援 Nvidia 晶片外,還針對華為昇騰和寒武紀晶片進行了優化,這表明其在中國國內市場的戰略重點,以應對美國的出口管制。
📊 競品分析▸ Show
| 實體/模型 | 開源狀態 | 架構特點 | 關鍵優勢 | 成本效益 (推論) |
|---|---|---|---|---|
| DeepSeek | 開源/開權重 | MoE (混合專家), MLA (多頭潛在注意力) | 高效率推理、強大推理與編碼能力、長上下文處理 | 極高 (例如,R1 比 OpenAI 便宜 96%) |
| OpenAI (ChatGPT/GPT-4) | 閉源 | 密集型 Transformer | 廣泛功能、強大編碼、多模態、成熟生態系統 | 較高 |
| Anthropic (Claude) | 閉源 | Transformer | 強大推理、長上下文處理、內建安全功能 | 中等 |
| Google (Gemini) | 閉源 (API 可用) | 多模態 Transformer | 多模態理解、與 Google 生態系統深度整合、代理能力 | 中等 |
| Meta (Llama) | 開權重 | 密集型 Transformer | 靈活的開源基礎設施、高度可客製化 | 中等 |
| Mistral AI | 開源 | MoE (部分模型) | 高效率、可客製化、多樣化模型產品 | 高 |
| Alibaba (Qwen) | 開源 | Transformer | 多語言能力、強大編碼和數學能力 | 高 |
🛠️ 技術深入
- 混合專家 (MoE) 架構: DeepSeek-V2、V3 和 V4 系列模型均採用 MoE 架構,將模型劃分為專業的「專家」子網路。每個 token 僅激活總參數的一小部分,例如 V2 總參數 2360 億,每 token 激活 210 億;V3 總參數 6710 億,每 token 激活 370 億;V4-Pro 總參數 1.6 兆,每 token 激活 490 億。這顯著降低了計算成本,同時保持了高性能。
- 多頭潛在注意力 (MLA): DeepSeek-V2 引入並在後續模型中沿用,這是一種新穎的注意力機制,通過低秩鍵值聯合壓縮顯著減少 KV 快取需求(例如 V2 減少 93.3%),從而實現高效推論並支援長達 128K token 的上下文視窗。
- DeepSeekMoE: 一種高效的 MoE 架構,包含路由專家和共享專家。DeepSeek-V3 的每個 MoE 層包含 1 個共享專家和 256 個路由專家,每個 token 激活 8 個路由專家。它還具有無輔助損失的負載平衡機制。
- 訓練效率: DeepSeek-V2 相較於 DeepSeek 67B 節省了 42.5% 的訓練成本。DeepSeek-V3 僅使用 280 萬 GPU 小時就達到了與 LLaMA 3 相當或更優的性能,而 LLaMA 3 則需要 3000 萬 GPU 小時。
- 多 token 預測 (MTP): DeepSeek-V3 採用 MTP 技術,通過順序預測未來 token 來提高訓練效率,同時保持因果鏈。
- 硬體優化: DeepSeek 的 V4 模型系列除了支援 Nvidia 外,還針對華為昇騰和寒武紀晶片進行了優化,以適應中國國內的硬體生態系統。
🔮 前景展望AI analysis grounded in cited sources
DeepSeek 的開源、高成本效益的 AGI 追求將加劇全球 AI 競爭,並加速高效模型架構的創新。
DeepSeek 通過以更低的成本展示高性能並開源其創新,促使其他實驗室採用類似的效率方法並分享研究成果,從而促進更具競爭力和協作性的 AI 開發格局。
接受外部資金可能會在未來引入商業壓力,從而微妙地影響 DeepSeek 純粹的研究重點。
儘管梁文鋒強調 AGI 優於營收,但接受來自騰訊和國家支持基金等投資者的外部資本,最終可能會導致對商業回報或戰略調整的期望。
DeepSeek 對中國國內硬體(華為昇騰、寒武紀)的優化將增強中國在 AI 基礎設施方面的自給自足能力。
這種戰略性的硬體兼容性降低了對美國晶片的依賴,減輕了出口管制的影響,並在中國培育了強大的國內 AI 生態系統。
⏳ 時間線
2023-07
DeepSeek 成立,由梁文鋒創立,並由其對沖基金 High-Flyer 提供資金。
2023-11
DeepSeek LLM 系列模型發布,包括 7B 和 67B 參數版本,並採用開源策略。
2024-05
DeepSeek-V2 發布,引入 MoE 架構和 Multi-head Latent Attention (MLA),顯著提升訓練和推論效率。
2024-12
DeepSeek-V3 發布,擁有 6710 億總參數和 370 億激活參數,並在性能上與 Claude 3.5 和 GPT-4o 媲美,同時訓練成本更低。
2025-01
DeepSeek-R1 推理模型發布,其性能與 OpenAI 的頂級模型相當,但訓練成本顯著降低,並推出同名聊天機器人。
2026-04
DeepSeek-V4-Pro (1.6 兆參數) 和 DeepSeek-V4-Flash (2840 億參數) 模型發布,並優化支援華為昇騰和寒武紀晶片。
📎 來源 (35)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- investing.com
- thenextweb.com
- biggo.com
- phemex.com
- techfundingnews.com
- chinatalk.media
- reddit.com
- pbs.org
- wikipedia.org
- digitalocean.com
- fintechweekly.com
- g2.com
- emergent.sh
- sintra.ai
- planetbanatt.net
- spectrumailab.com
- o-mega.ai
- milvus.io
- chat-deep.ai
- medium.com
- milvus.io
- gopenai.com
- github.com
- huggingface.co
- medium.com
- chipstrat.com
- bentoml.com
- nvidia.com
- medium.com
- github.io
- github.com
- issarice.com
- scmp.com
- mindstudio.ai
- huggingface.co
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: The Next Web (TNW) ↗



