📊Bloomberg Technology•較早收集於 33m
DeepSeek 啟動 100 億美元融資,目標直指 AGI

💡DeepSeek 轉向 AGI 的 100 億美元融資,預示著基礎模型競爭格局的重大轉變。
⚡ 30-Second TL;DR
有什麼變化
DeepSeek 正尋求 700 億人民幣(約 100 億美元)的新資金。
為什麼重要
此策略轉向顯示 DeepSeek 意圖透過專注於基礎模型能力,而非立即產品化,來與 OpenAI 和 Anthropic 等頂尖實驗室直接競爭。
下一步行動
密切關注 DeepSeek 的 GitHub 與研究論文,留意可能挑戰現有 SOTA 模型的新架構突破。
誰應關注:Founders & Product Leaders
關鍵要點
- •DeepSeek 正尋求 700 億人民幣(約 100 億美元)的新資金。
- •公司將重心轉向 AGI 研究,而非追求短期營收。
- •管理層正積極向潛在投資者傳達此長期願景。
🧠 深度解析
Web-grounded analysis with 26 cited sources.
🔑 增強重點摘要
- •DeepSeek最初尋求至少3億美元的外部資金,公司估值超過100億美元,但此估值在短短幾週內迅速飆升至450億美元,並可能由中國國家集成電路產業投資基金(「大基金」)領投。
- •DeepSeek由中國量化對沖基金幻方量化的共同創辦人梁文鋒於2023年7月創立,此前一直由母公司內部供血,此次是其首次尋求外部融資。
- •DeepSeek的模型,特別是2025年1月發布的DeepSeek-R1推理模型,以其顯著低於西方同行的訓練成本(據報僅600萬美元,而OpenAI的GPT-4為1億美元)卻能達到可比性能而備受關注。
- •公司轉向外部融資的部分原因,是開發大型語言模型不斷上升的營運成本,以及近期核心人才流失至小米、字節跳動等大型科技公司。
- •DeepSeek的模型多數採用「開放權重」策略,並在MIT許可證下發布,旨在降低AI開發門檻,促進技術普及和開源生態發展。
📊 競品分析▸ Show
| 模型 | 總參數 (約) | 激活參數 (約) | 上下文窗口 | 基準分數 (MMLU-Pro/整體) | 價格 (每百萬token) | 架構 | 備註 |
|---|---|---|---|---|---|---|---|
| DeepSeek V4 Pro (Max) | 1.6兆 | 490億 | 100萬 | 87.5% (MMLU-Pro), 88 (整體) | $0.71 (混合) | MoE | 性能接近頂級閉源模型 |
| DeepSeek V4 Flash (Max) | 2840億 | 130億 | 100萬 | 76 (整體) | $0.06 (混合) | MoE | 針對快速推理和高吞吐量優化 |
| DeepSeek V3 | 6710億 | 370億 | 128K | 優於GPT-4o, LLaMA-3.1–405B (MMLU-Pro, GPQA-Diamond, MATH 500, AIME 2024) | N/A | MoE | 支援「思考模式」 |
| DeepSeek R1 | 6710億 (總) | 370億 (激活) | N/A | 媲美GPT-4和o1 | $0.55 (每百萬輸入token) | MoE, 強化學習 | 訓練成本低 ($6M) |
| OpenAI GPT-4 | 1.8兆 (估計) | N/A | N/A | N/A | $100M (訓練成本, 2023) | Transformer | 業界標竿,但訓練成本高 |
| Alibaba Qwen 2.5-Max | >20兆 (預訓練tokens) | N/A | N/A | 聲稱超越DeepSeek V3, Llama 3.1 | N/A | MoE | 中國市場主要競爭者 |
| ByteDance Doubao 1.5 Pro | N/A | N/A | N/A | BBH: 91.6, McEval: 70.2 (超越GPT-4部分指標) | N/A | 稀疏MoE | 採用自主數據生產體系 |
🛠️ 技術深入
- DeepSeek模型(包括V3和V4系列)採用混合專家(Mixture-of-Experts, MoE)架構,以提高效率和性能。
- DeepSeek-V3總參數為6710億,每次推斷激活370億參數,上下文長度可達128K tokens。
- DeepSeek-V4-Pro總參數為1.6兆,DeepSeek-V4-Flash總參數為2840億,激活參數為130億,兩者均支援100萬token的上下文窗口。
- V4系列引入了多項架構創新,包括混合注意力架構(結合壓縮稀疏注意力與重度壓縮注意力)以提升長上下文效率、流形約束超連接(mHC)以增強訊號傳播穩定性,以及Muon優化器以加速收斂和提高訓練穩定性。
- DeepSeek模型還整合了多頭潛在注意力(Multi-Head Latent Attention, MLA)機制,透過壓縮鍵值(KV)緩存來優化注意力機制,顯著降低推斷時的記憶體消耗。
- DeepSeek-R1採用「強化學習優先」(RL-first)的訓練方法,不依賴大規模人工標註數據,而是透過獎勵機制引導模型學習,據報有效降低了訓練成本。
- DeepSeek-V3的MoE架構包含1個共享專家和256個路由專家,每個Token選擇8個路由專家。
🔮 前景展望AI analysis grounded in cited sources
DeepSeek的巨額融資將加速全球AGI競賽的進程。
獲得巨額資金將使DeepSeek能夠投入更多資源進行長期研究,並吸引頂尖人才,從而推動AGI技術的快速發展。
DeepSeek的開源策略將對AI產業的生態系統產生深遠影響。
透過MIT許可證開放模型權重,DeepSeek降低了AI開發的門檻,鼓勵了更廣泛的創新和應用,可能促使更多公司採用開放模型。
中國政府對DeepSeek的潛在投資將加劇全球AI領域的地緣政治競爭。
若中國國家級基金成為主要投資者,將凸顯AI技術的國家戰略重要性,可能引發其他國家對其本土AI企業的類似支持,進一步激化國際競爭。
⏳ 時間線
2023-07
DeepSeek公司成立
2023-11
發布首個模型DeepSeek Coder
2024-01
發布DeepSeek LLM系列模型並開源
2024-05
發布DeepSeek-V2混合專家模型
2024-12
發布DeepSeek-V3模型
2025-01
發布DeepSeek-R1推理模型及同名聊天機器人App
2026-04
發布DeepSeek-V4系列預覽版,支援100萬token上下文窗口
2026-04
啟動首次外部融資,目標估值超過100億美元
📎 來源 (26)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- thenextweb.com
- biggo.jp
- techfundingnews.com
- gurufocus.com
- newsweekjapan.jp
- wikipedia.org
- ifeng.com
- cnyes.com
- biggo.com.tw
- benchlm.ai
- deepseek.com
- datacamp.com
- bentoml.com
- artificialanalysis.ai
- openrouter.ai
- apxml.com
- fireworks.ai
- medium.com
- cnblogs.com
- pagerank.ing
- arize.com
- cw.com.tw
- bnext.com.tw
- szlh.gov.cn
- hkai-solve-academy.com
- csdn.net
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Bloomberg Technology ↗