🏕️較早收集於 29m

DeepSeek 融資與中國大模型產業格局分析

PostLinkedIn
🏕️閱讀原文: 极客公园

💡DeepSeek 破紀錄融資預示中國 AI 格局變動,深入了解大模型競賽的最新生存法則。

⚡ 30-Second TL;DR

有什麼變化

DeepSeek 完成破紀錄的首輪融資,凸顯了在 Scaling law 時代競爭所需的海量資本需求。

為什麼重要

此次融資凸顯中國 AI 企業正超越單純的技術研發,轉向追求「工業主權」,並將 AI 與核心業務深度整合以確保長期生存。

下一步行動

評估您的模型對外部 API 的依賴程度,並考慮建立內部的「工業級」AI 能力,以避免核心業務長期出現「空心化」。

誰應關注:Founders & Product Leaders

關鍵要點

  • DeepSeek 完成破紀錄的首輪融資,凸顯了在 Scaling law 時代競爭所需的海量資本需求。
  • 市場正演變為三類玩家:擁有強大「A 面」業務的科技巨頭、專注 AI 的新創公司,以及具備深厚技術底蘊的高利潤企業。
  • DeepSeek 透過與國產算力生態的深度整合及對開源的承諾,與國家科技戰略目標保持一致,形成獨特競爭優勢。
  • Scaling law 仍是模型效能提升的核心驅動力,持續且大規模的投入是留在牌桌上的必要條件。

🧠 深度解析

Web-grounded analysis with 33 cited sources.

🔑 增強重點摘要

  • DeepSeek據報完成的破紀錄首輪融資,目標募資額高達30至40億美元,公司估值可能達到500億美元,其中中國國家集成電路產業投資基金(俗稱「國家大基金」)和騰訊均有意參與,而創辦人梁文鋒個人也可能出資高達40%。
  • DeepSeek已從過去「不融資、不商業化」的策略轉向,積極尋求外部資金並加速商業化進程,此轉變主要受不斷攀升的算力成本和頂尖人才競爭加劇所驅動,並計劃於2026年6月發布V4.1模型以強化企業級AI應用能力。
  • DeepSeek-V4模型於2026年4月發布,原生支援100萬(1M)token上下文長度,並已完成與華為昇騰晶片的深度適配,這不僅降低了對NVIDIA高端GPU的依賴,也為中國本土晶片產業鏈提供了發展動能,形成自給自足的技術閉環。
  • DeepSeek於2026年5月推出識圖模式,採用「視覺原語思考」核心框架,將點、邊界框等空間視覺元素作為思維基本單元,顯著提升了複雜空間布局和密集計數等場景的推理精度,同時處理800x800分辨率圖片僅消耗約90個tokens,展現出算力友好的特性。
  • DeepSeek的開源模型,特別是DeepSeek-V2和DeepSeek-Coder-V2,在編程和數學基準測試中表現優異,甚至超越了GPT-4 Turbo等閉源模型,並以極具競爭力的API定價(例如V4-Pro輸入價格低至人民幣0.25元/百萬Token)引發了中國AI市場的新一輪價格戰。
📊 競品分析▸ Show
模型名稱/公司特點/功能API定價 (輸入/輸出)基準測試/性能
DeepSeek-V4-Pro旗艦版,1.6兆參數,1M上下文,原生多模態輸入,Agentic Coding優化,華為昇騰晶片適配。輸入:人民幣0.25元/百萬Token (快取命中),人民幣3元/百萬Token (快取未命中);輸出:人民幣6元/百萬Token (優惠期)Agent執行能力內部測試超越Claude 3.5 Sonnet,接近Claude Opus 4.6非思考模式。
DeepSeek-V4-Flash高速版,2840億參數,1M上下文,原生多模態輸入,主打極速反應與經濟效益。輸出:人民幣2元/百萬Token在簡單Agent任務上與Pro版旗鼓相當。
DeepSeek-Coder-V2獨特MoE框架,支援338種編程語言,6兆額外標籤訓練。開源且商業和研究用途無限制。HumanEval得分90.2%,MBPP得分76.2%,超越GPT4-Turbo、Claude 3 Opus、Gemini 1.5 Pro在編碼和數學基準測試中。
OpenAI GPT-5.5 Pro主流閉源模型。輸入:30美元/百萬Token;輸出:180美元/百萬Token (加權平均)-
Anthropic Claude Opus系列主流閉源模型。輸出:通常在12至25美元/百萬Token之間。-
Google Gemini 3.1 Pro系列主流閉源模型。輸出:通常在12至25美元/百萬Token之間。-
騰訊Hy3 preview (free)中國AI大模型。免費。2026年5月4日至5月10日全球週調用量榜首 (2.68萬億Token)。
Kimi K2.6 (月之暗面)中國AI大模型。-2026年5月4日至5月10日全球週調用量排名第二 (1.61萬億Token)。

🛠️ 技術深入

  • DeepSeek模型主要基於Transformer架構進行訓練,並針對中文語言特性進行優化。
  • DeepSeek-V2引入了Multi-head Latent Attention (MLA) 機制和DeepSeek Mixture-of-Experts (MoE) 架構。
  • MLA通過低秩的鍵值結合壓縮來解決傳統多頭注意力(MHA)在推論時鍵值快取(KV Cache)的記憶體瓶頸,顯著減少記憶體使用量並提高計算效率。
  • DeepSeek MoE採用了更細分的專家分割,包含處理普遍資訊的「共享專家」(shared experts)和針對特定輸入啟動的「路由專家」(routed experts),並具備負載均衡機制以避免特定專家過度選擇。
  • DeepSeek-Coder-V2採用MoE框架,支援多達338種編程語言,並使用包含60%原始碼、10%數學語料和30%自然語言語料的6兆額外標籤進行訓練。
  • DeepSeek-V4系列模型原生支援100萬(1M)token上下文長度,並採用Muon優化器。
  • DeepSeek-V4支援原生多模態輸入(文本、圖像、音訊),但輸出形式仍以文字生成為主。
  • DeepSeek的識圖模式採用「視覺原語思考」框架,將點、邊界框等空間視覺元素作為模型推理的基本單元,以解決傳統多模態模型在密集場景中的「指代鴻溝」問題,提升空間推理精度。

🔮 前景展望AI analysis grounded in cited sources

中國AI產業的自主可控能力將顯著提升。
DeepSeek與華為昇騰晶片的深度整合,以及國家大基金的投資,將加速中國在AI硬體和模型生態系統上的自給自足,減少對西方技術的依賴。
中國AI大模型市場的商業化競爭將更加激烈。
DeepSeek從研究優先轉向積極融資和商業化,並以「骨折價」發布V4模型,預計將引發新一輪行業價格戰,加速AI應用普及和商業模式創新。
AI Agent和多模態能力將成為中國大模型發展的關鍵方向。
DeepSeek-V4在Agentic Coding上的優化和識圖模式的推出,以及對原生多模態輸入的支援,表明未來模型將更注重複雜任務執行和多感官理解能力。

時間線

2015-XX
幻方量化成立,創辦人為梁文鋒。
2021-XX
幻方量化投資10億元推出「螢火二號」超級電腦,搭載約1萬張NVIDIA A100顯示卡。
2023-07-17
杭州深度求索人工智能基礎技術研究有限公司成立。
2024-05
DeepSeek-V2(採用MoE和MLA架構)發布。
2025-01
DeepSeek-R1旗艦開源模型發布,基於MIT許可證。
2026-04-24
DeepSeek-V4 Preview發布,支援1M上下文並適配華為昇騰晶片。
2026-04-26
DeepSeek宣布V4模型大幅降價,引發行業價格戰。
2026-05-07
路透社報導DeepSeek首次融資估值或高達500億美元,國家大基金和騰訊有意投資。
2026-05-14
DeepSeek識圖模式開始灰度測試並大範圍開放,採用「視覺原語思考」框架。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 极客公园