📊較早收集於 41m

DeepSeek 接近完成 74 億美元融資以實現 AI 野心

PostLinkedIn
📊閱讀原文: Bloomberg Technology

💡74 億美元的巨額融資預示著全球 AI 競爭格局的重大轉變。

⚡ 30-Second TL;DR

有什麼變化

DeepSeek 完成 74 億美元歷史性融資

為什麼重要

資金注入可能會加速中國市場高效能大型語言模型(LLM)的開發。

下一步行動

將 DeepSeek 的最新模型與當前 SOTA 開源替代方案進行基準測試,以評估其對您使用案例的效能。

誰應關注:Researchers & Academics

關鍵要點

  • DeepSeek 完成 74 億美元歷史性融資
  • Tencent 作為關鍵投資人參與
  • 挑戰 OpenAI 等美國 AI 領導者的戰略目標

🧠 深度解析

Web-grounded analysis with 30 cited sources.

🔑 增強重點摘要

  • 本次融資是 DeepSeek 首次對外募資,其創辦人梁文鋒承諾投入200億人民幣(約29億美元)自有資金,顯示出對公司未來發展的強烈信心。
  • 本輪融資完成後,DeepSeek 的估值預計將達到最高4000億人民幣(約591億美元)。
  • 除了騰訊,其他主要投資者還包括寧德時代(CATL)、網易、京東、中國國家人工智慧基金和IDG資本,這反映了中國在建立自主AI供應鏈方面的廣泛國家戰略。
  • DeepSeek 的模型,特別是 DeepSeek-R1 和 V3,因其性能可與 OpenAI 的 GPT-4 和 o1 等領先美國模型媲美,且訓練成本和 API 定價顯著較低而受到國際關注,挑戰了外界對中國 AI 能力的假設。
  • DeepSeek 近期推出了 V4 系列,包括 DeepSeek-V4-Pro(1.6兆參數MoE模型)和 DeepSeek-V4-Flash(284B參數模型),這些模型具有100萬token的上下文窗口和原生多模態支持,預計比 GPT-5.4 和 Claude Opus 4.8 便宜10-50倍。
📊 競品分析▸ Show
特性/模型DeepSeek V3.2 (API)DeepSeek R1 (API)DeepSeek V4 Pro (預計)OpenAI GPT-5.4 (API)Anthropic Claude Sonnet 4.6 (API)
價格 (每百萬token)輸入: $0.14 (快取命中: $0.014) 輸出: $0.28輸入: $0.55 輸出: $2.19輸入/輸出: 預計比GPT-5.4和Claude Opus 4.8便宜10-50倍輸入: $2.50 輸出: $15.00輸入: $3.00 輸出: $15.00
架構MoE, MLA, MTPMoE, MLA, TransformerMoE (~1.6兆參數, 49B活躍), CSA, Lightning Indexer, 原生多模態專有專有
上下文長度64,000 tokens (最大32,000輸入, 8,000輸出)未明確說明,但強調長上下文效率100萬 tokens未明確說明,但通常較長未明確說明,但通常較長
性能亮點最便宜的LLM API數學推理和編碼表現優異,在AIME等基準測試中超越OpenAI o11兆參數,原生多模態,高效處理長上下文廣泛的通用能力,高質量輸出強調安全性、細緻推理
開源狀態開源權重開源權重預計開源權重 (Apache 2.0 許可證)閉源閉源

🛠️ 技術深入

  • DeepSeek 模型(如 V3、R1、V4)採用「專家混合」(Mixture-of-Experts, MoE)架構,以減少計算負載並實現高效擴展。
  • 運用「多頭潛在注意力」(Multi-Head Latent Attention, MLA)機制,透過壓縮鍵值(Key-Value)快取,實現高效推斷,尤其適用於長上下文處理。
  • 採用「多token預測」(Multi-Token Prediction, MTP)訓練目標,以提供更密集的訓練信號並提高數據效率。
  • DeepSeek-R1 總參數達6710億,但在單次前向傳播中僅激活370億參數,顯著降低了計算開銷。
  • DeepSeek-V4 引入了「壓縮稀疏注意力」(Compressed Sparse Attention, CSA)和「閃電索引器」(Lightning Indexer),以高效處理100萬token的上下文。
  • DeepSeek-V4-Pro 是一個1.6兆參數的 MoE 模型,每個token激活490億參數。
  • DeepSeek-V4 支持三種明確的推理模式:「非思考」(Non-think)、「高思考」(Think High)和「最大思考」(Think Max)。
  • DeepSeek 模型設計注重成本效益,能夠在較低端的硬體上有效運行。
  • DeepSeek-Coder 經過338種程式語言的訓練,在程式碼生成和理解方面表現出色。

🔮 前景展望AI analysis grounded in cited sources

DeepSeek 將加速全球 AI 模型價格戰。
其模型以顯著低於美國競爭對手的價格提供可比性能,將迫使市場其他參與者調整定價策略以保持競爭力。
中國在 AI 領域的自給自足能力將顯著增強。
本輪融資吸引了包括國有基金和電池巨頭寧德時代在內的廣泛中國投資者,表明國家層面支持建立獨立 AI 供應鏈的戰略意圖。
多模態 AI 模型的普及和本地部署將加速。
DeepSeek V4 原生支持多模態且預計提供開源權重,並可在消費級 GPU 上運行,將降低多模態 AI 的進入門檻。

時間線

2016-02
梁文鋒共同創立對沖基金 High-Flyer,利用 AI 進行股票交易。
2023-07
DeepSeek 由梁文鋒創立,作為 High-Flyer 旗下的 AI 研究實驗室。
2023-11
推出 DeepSeek-Coder 和 DeepSeek LLM 系列開源模型。
2024-05
推出 DeepSeek-V2,以其經濟實惠的定價擾亂了 AI 市場,促使競爭對手降價。
2024-12
推出 DeepSeek-V3,一款先進模型,以較低的成本實現了與領先 AI 系統相當的性能。
2025-01
推出 DeepSeek-R1 模型及其聊天機器人應用程式,在全球範圍內引起關注,並在美國 iOS 應用商店中超越 ChatGPT 成為下載量最高的免費應用程式。
2026-05
推出 DeepSeek V4 系列,包括 DeepSeek-V4-Pro 和 DeepSeek-V4-Flash,具有1兆參數、100萬token上下文窗口和原生多模態支持。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Bloomberg Technology