來源Bloomberg Technology•較早收集於 33m
DeepSeek 啟動 100 億美元融資,目標直指 AGI

DeepSeek 轉向 AGI 的 100 億美元融資,預示著基礎模型競爭格局的重大轉變。
30 秒速覽
有什麼變化
DeepSeek 正尋求 700 億人民幣(約 100 億美元)的新資金。
為什麼重要
此策略轉向顯示 DeepSeek 意圖透過專注於基礎模型能力,而非立即產品化,來與 OpenAI 和 Anthropic 等頂尖實驗室直接競爭。
下一步行動
密切關注 DeepSeek 的 GitHub 與研究論文,留意可能挑戰現有 SOTA 模型的新架構突破。
誰應關注:Founders & Product Leaders
關鍵要點
- •DeepSeek 正尋求 700 億人民幣(約 100 億美元)的新資金。
- •公司將重心轉向 AGI 研究,而非追求短期營收。
- •管理層正積極向潛在投資者傳達此長期願景。
關鍵數字3億100億450億600萬
深度解析
背景與延伸:來自公開資料,非原文內容。引用 26 個來源。
增強重點摘要
- •DeepSeek最初尋求至少3億美元的外部資金,公司估值超過100億美元,但此估值在短短幾週內迅速飆升至450億美元,並可能由中國國家集成電路產業投資基金(「大基金」)領投。
- •DeepSeek由中國量化對沖基金幻方量化的共同創辦人梁文鋒於2023年7月創立,此前一直由母公司內部供血,此次是其首次尋求外部融資。
- •DeepSeek的模型,特別是2025年1月發布的DeepSeek-R1推理模型,以其顯著低於西方同行的訓練成本(據報僅600萬美元,而OpenAI的GPT-4為1億美元)卻能達到可比性能而備受關注。
- •公司轉向外部融資的部分原因,是開發大型語言模型不斷上升的營運成本,以及近期核心人才流失至小米、字節跳動等大型科技公司。
- •DeepSeek的模型多數採用「開放權重」策略,並在MIT許可證下發布,旨在降低AI開發門檻,促進技術普及和開源生態發展。
競品分析
DeepSeek V4 Pro (Max)
- 總參數 (約)
- 1.6兆
- 激活參數 (約)
- 490億
- 上下文窗口
- 100萬
- 基準分數 (MMLU-Pro/整體)
- 87.5% (MMLU-Pro), 88 (整體)
- 價格 (每百萬token)
- $0.71 (混合)
- 架構
- MoE
- 備註
- 性能接近頂級閉源模型
DeepSeek V4 Flash (Max)
- 總參數 (約)
- 2840億
- 激活參數 (約)
- 130億
- 上下文窗口
- 100萬
- 基準分數 (MMLU-Pro/整體)
- 76 (整體)
- 價格 (每百萬token)
- $0.06 (混合)
- 架構
- MoE
- 備註
- 針對快速推理和高吞吐量優化
DeepSeek V3
- 總參數 (約)
- 6710億
- 激活參數 (約)
- 370億
- 上下文窗口
- 128K
- 基準分數 (MMLU-Pro/整體)
- 優於GPT-4o, LLaMA-3.1–405B (MMLU-Pro, GPQA-Diamond, MATH 500, AIME 2024)
- 價格 (每百萬token)
- N/A
- 架構
- MoE
- 備註
- 支援「思考模式」
DeepSeek R1
- 總參數 (約)
- 6710億 (總)
- 激活參數 (約)
- 370億 (激活)
- 上下文窗口
- N/A
- 基準分數 (MMLU-Pro/整體)
- 媲美GPT-4和o1
- 價格 (每百萬token)
- $0.55 (每百萬輸入token)
- 架構
- MoE, 強化學習
- 備註
- 訓練成本低 ($6M)
OpenAI GPT-4
- 總參數 (約)
- 1.8兆 (估計)
- 激活參數 (約)
- N/A
- 上下文窗口
- N/A
- 基準分數 (MMLU-Pro/整體)
- N/A
- 價格 (每百萬token)
- $100M (訓練成本, 2023)
- 架構
- Transformer
- 備註
- 業界標竿,但訓練成本高
Alibaba Qwen 2.5-Max
- 總參數 (約)
20兆 (預訓練tokens)
- 激活參數 (約)
- N/A
- 上下文窗口
- N/A
- 基準分數 (MMLU-Pro/整體)
- 聲稱超越DeepSeek V3, Llama 3.1
- 價格 (每百萬token)
- N/A
- 架構
- MoE
- 備註
- 中國市場主要競爭者
ByteDance Doubao 1.5 Pro
- 總參數 (約)
- N/A
- 激活參數 (約)
- N/A
- 上下文窗口
- N/A
- 基準分數 (MMLU-Pro/整體)
- BBH: 91.6, McEval: 70.2 (超越GPT-4部分指標)
- 價格 (每百萬token)
- N/A
- 架構
- 稀疏MoE
- 備註
- 採用自主數據生產體系
| 模型 | 總參數 (約) | 激活參數 (約) | 上下文窗口 | 基準分數 (MMLU-Pro/整體) | 價格 (每百萬token) | 架構 | 備註 |
|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro (Max) | 1.6兆 | 490億 | 100萬 | 87.5% (MMLU-Pro), 88 (整體) | $0.71 (混合) | MoE | 性能接近頂級閉源模型 |
| DeepSeek V4 Flash (Max) | 2840億 | 130億 | 100萬 | 76 (整體) | $0.06 (混合) | MoE | 針對快速推理和高吞吐量優化 |
| DeepSeek V3 | 6710億 | 370億 | 128K | 優於GPT-4o, LLaMA-3.1–405B (MMLU-Pro, GPQA-Diamond, MATH 500, AIME 2024) | N/A | MoE | 支援「思考模式」 |
| DeepSeek R1 | 6710億 (總) | 370億 (激活) | N/A | 媲美GPT-4和o1 | $0.55 (每百萬輸入token) | MoE, 強化學習 | 訓練成本低 ($6M) |
| OpenAI GPT-4 | 1.8兆 (估計) | N/A | N/A | N/A | $100M (訓練成本, 2023) | Transformer | 業界標竿,但訓練成本高 |
| Alibaba Qwen 2.5-Max | 20兆 (預訓練tokens) | N/A | N/A | 聲稱超越DeepSeek V3, Llama 3.1 | N/A | MoE | 中國市場主要競爭者 |
| ByteDance Doubao 1.5 Pro | N/A | N/A | N/A | BBH: 91.6, McEval: 70.2 (超越GPT-4部分指標) | N/A | 稀疏MoE | 採用自主數據生產體系 |
技術深入
- DeepSeek模型(包括V3和V4系列)採用混合專家(Mixture-of-Experts, MoE)架構,以提高效率和性能。
- DeepSeek-V3總參數為6710億,每次推斷激活370億參數,上下文長度可達128K tokens。
- DeepSeek-V4-Pro總參數為1.6兆,DeepSeek-V4-Flash總參數為2840億,激活參數為130億,兩者均支援100萬token的上下文窗口。
- V4系列引入了多項架構創新,包括混合注意力架構(結合壓縮稀疏注意力與重度壓縮注意力)以提升長上下文效率、流形約束超連接(mHC)以增強訊號傳播穩定性,以及Muon優化器以加速收斂和提高訓練穩定性。
- DeepSeek模型還整合了多頭潛在注意力(Multi-Head Latent Attention, MLA)機制,透過壓縮鍵值(KV)緩存來優化注意力機制,顯著降低推斷時的記憶體消耗。
- DeepSeek-R1採用「強化學習優先」(RL-first)的訓練方法,不依賴大規模人工標註數據,而是透過獎勵機制引導模型學習,據報有效降低了訓練成本。
- DeepSeek-V3的MoE架構包含1個共享專家和256個路由專家,每個Token選擇8個路由專家。
前景展望基於引用來源的 AI 分析
DeepSeek的巨額融資將加速全球AGI競賽的進程。
獲得巨額資金將使DeepSeek能夠投入更多資源進行長期研究,並吸引頂尖人才,從而推動AGI技術的快速發展。
DeepSeek的開源策略將對AI產業的生態系統產生深遠影響。
透過MIT許可證開放模型權重,DeepSeek降低了AI開發的門檻,鼓勵了更廣泛的創新和應用,可能促使更多公司採用開放模型。
中國政府對DeepSeek的潛在投資將加劇全球AI領域的地緣政治競爭。
若中國國家級基金成為主要投資者,將凸顯AI技術的國家戰略重要性,可能引發其他國家對其本土AI企業的類似支持,進一步激化國際競爭。
時間線
2023-07
DeepSeek公司成立
2023-11
發布首個模型DeepSeek Coder
2024-01
發布DeepSeek LLM系列模型並開源
2024-05
發布DeepSeek-V2混合專家模型
2024-12
發布DeepSeek-V3模型
2025-01
發布DeepSeek-R1推理模型及同名聊天機器人App
2026-04
發布DeepSeek-V4系列預覽版,支援100萬token上下文窗口
2026-04
啟動首次外部融資,目標估值超過100億美元
- 2023-07DeepSeek公司成立
- 2023-11發布首個模型DeepSeek Coder
- 2024-01發布DeepSeek LLM系列模型並開源
- 2024-05發布DeepSeek-V2混合專家模型
- 2024-12發布DeepSeek-V3模型
- 2025-01發布DeepSeek-R1推理模型及同名聊天機器人App
- 2026-04發布DeepSeek-V4系列預覽版,支援100萬token上下文窗口
- 2026-04啟動首次外部融資,目標估值超過100億美元
來源 (26)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
1thenextweb.comvertexaisearch.cloud.google.com2biggo.jpvertexaisearch.cloud.google.com3techfundingnews.comvertexaisearch.cloud.google.com4gurufocus.comvertexaisearch.cloud.google.com5newsweekjapan.jpvertexaisearch.cloud.google.com6wikipedia.orgvertexaisearch.cloud.google.com7ifeng.comvertexaisearch.cloud.google.com8cnyes.comvertexaisearch.cloud.google.com9biggo.com.twvertexaisearch.cloud.google.com10benchlm.aivertexaisearch.cloud.google.com11deepseek.comvertexaisearch.cloud.google.com12datacamp.comvertexaisearch.cloud.google.com13bentoml.comvertexaisearch.cloud.google.com14artificialanalysis.aivertexaisearch.cloud.google.com15openrouter.aivertexaisearch.cloud.google.com16apxml.comvertexaisearch.cloud.google.com17fireworks.aivertexaisearch.cloud.google.com18medium.comvertexaisearch.cloud.google.com19cnblogs.comvertexaisearch.cloud.google.com20pagerank.ingvertexaisearch.cloud.google.com21arize.comvertexaisearch.cloud.google.com22cw.com.twvertexaisearch.cloud.google.com23bnext.com.twvertexaisearch.cloud.google.com24szlh.gov.cnvertexaisearch.cloud.google.com25hkai-solve-academy.comvertexaisearch.cloud.google.com26csdn.netvertexaisearch.cloud.google.com
AI 週報
閱讀本週精選 AI 大事摘要 →
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Bloomberg Technology ↗
每週電子報
每週一封,可隨時退訂。