🐯較早收集於 5m

DeepSeek 融資揭示科技巨頭截然不同的 AI 戰略

DeepSeek 融資揭示科技巨頭截然不同的 AI 戰略
PostLinkedIn
🐯閱讀原文: 虎嗅

💡深入了解 Alibaba、Tencent 和 ByteDance 如何透過資本佈局影響中國 AI 生態的未來。

⚡ 30-Second TL;DR

有什麼變化

Alibaba 試圖將 AI 模型整合進生態以獲取控制權,而 Tencent 則偏好「輕參與」的財務投資模式。

為什麼重要

這些巨頭的分歧策略將重塑中國 AI 基礎設施與應用部署的競爭格局。

下一步行動

在接受大型科技公司注資前,請評估貴公司的 AI 成長策略是傾向於「生態整合」還是「獨立基礎設施」。

誰應關注:Founders & Product Leaders

關鍵要點

  • Alibaba 試圖將 AI 模型整合進生態以獲取控制權,而 Tencent 則偏好「輕參與」的財務投資模式。
  • ByteDance 正投入 2000 億資金,專注於「豆包」App 以搶佔 C 端用戶時長。
  • DeepSeek 堅持獨立發展,避免被鎖定在任何巨頭的基礎設施中。

🧠 深度解析

Web-grounded analysis with 32 cited sources.

🔑 增強重點摘要

  • DeepSeek近期完成的首輪外部融資規模龐大,目標估值高達500億美元,由中國國家人工智慧產業投資基金和中國集成電路產業投資基金(大基金三期)領投,騰訊亦有參與,這凸顯了國家對DeepSeek的戰略支持與重視。
  • DeepSeek的模型,特別是DeepSeek-V2和DeepSeek-R1,以其卓越的成本效益著稱,據報導其V3模型訓練成本不到600萬美元,遠低於OpenAI GPT-4的1億美元,並能以顯著降低的推理成本提供與領先西方模型相當的性能。
  • 阿里巴巴正積極將其通義(Qwen)AI模型深度整合至核心電商和雲端業務中,目標是到2026年底實現超過44億美元的AI相關收入,並預計AI產品在一年內將貢獻超過50%的雲收入。
  • 字節跳動的「豆包」應用程式已成為中國最廣泛使用的AI應用,截至2025年底日活躍用戶超過1億,目前正測試分級訂閱模式以實現商業化,以應對每日處理超過120兆tokens所帶來的高昂計算成本。
  • 騰訊計劃在2026年將其AI投資翻倍,重點投入其混元(HunYuan)基礎模型和元寶(Yuanbao)聊天機器人,並在微信生態系統內開發AI代理,這表明其AI戰略正從「輕參與」的財務投資轉向更直接、更實質性的自主研發。
📊 競品分析▸ Show

DeepSeek作為基礎模型提供商,其主要競爭對手包括OpenAI、Google、Anthropic等國際巨頭以及中國國內的智譜AI、MiniMax、月之暗面等。以下為DeepSeek-V2與部分競爭模型的性能及效率比較:

模型名稱總參數量 (活躍參數)上下文窗口MT-Bench (對話推理)HumanEval (程式碼)GSM8K (數學)每百萬Token推理成本 (約)
DeepSeek-V2236B (21B)128K8.783%84%~0.14美元
GPT-4 Turbo--8.886%--
Claude 3 Opus--9.0---
Gemini 1.5 Pro---83.5%--
Llama 3 70B70B--80%-~1.85美元
DeepSeek-Coder-V2236B (21B)128K-87.8% (優於GPT-4T)87.9% (優於GPT-4T)-
Qwen 3.6-Plus-1M---0.50美元 (輸入)

主要特點對比:

  • DeepSeek-V2/Coder-V2:採用MoE架構和Multi-Head Latent Attention (MLA) 技術,顯著提升訓練和推理效率,降低成本,並支持多達338種程式語言。
  • OpenAI GPT系列:通常為閉源模型,性能強大,但成本較高,具體架構細節不公開。
  • Google Gemini系列:多模態能力強大,性能領先,但具體成本和架構細節需依賴官方發布。
  • Claude 3 Opus:以其強大的推理能力和長上下文窗口著稱,但通常為閉源且成本較高。
  • Llama 3:Meta發布的開源模型,廣受歡迎,但DeepSeek在成本效益上表現更優。
  • 阿里巴巴通義(Qwen):同樣採用MoE架構,並強調與其雲服務和電商生態的深度整合,API定價具競爭力。
  • 字節跳動豆包:強調C端用戶體驗和多模態能力,以極低成本提供服務,並開始探索付費模式。

🛠️ 技術深入

  • 模型架構:DeepSeek-V2採用創新的混合專家(Mixture-of-Experts, MoE)架構,總參數達2360億,但每個token僅激活約210億參數,顯著提升了計算效率。
  • 注意力機制:引入了多頭潛在注意力(Multi-Head Latent Attention, MLA)機制,該機制能將Key-Value (KV) 緩存壓縮為潛在向量,在推理時將KV緩存大小減少93.3%,大幅提升推理效率和吞吐量。
  • 訓練效率:DeepSeekMoE架構通過稀疏計算實現經濟高效的模型訓練,據報導其V3模型僅使用2,000塊NVIDIA H800晶片,訓練成本不到600萬美元。
  • 上下文窗口:DeepSeek-V2和DeepSeek-Coder-V2均支持長達128K tokens的上下文窗口,DeepSeek-V4系列模型更是達到1百萬token。
  • 程式碼模型:DeepSeek-Coder-V2是從DeepSeek-V2的檢查點進一步預訓練而來,額外使用了6兆tokens的程式碼數據,支持多達338種程式語言,並在程式碼生成、修復和數學推理等任務上表現出色。
  • 成本效益:DeepSeek V2風格的架構在處理100K上下文窗口時,每百萬tokens的推理成本約為0.14美元,遠低於傳統標準注意力模型(如Llama 3 70B級別)的約1.85美元。

🔮 前景展望AI analysis grounded in cited sources

中國國家隊對DeepSeek的投資將加速其技術發展並鞏固其在國內AI領域的領導地位。
國家級基金的參與不僅提供巨額資金,更代表了國家層面的戰略支持,有助於DeepSeek獲取更多資源和政策傾斜,以應對國際競爭。
DeepSeek的成本效益和開放權重策略將持續推動AI模型市場的「價格戰」和開源趨勢。
DeepSeek以極低的成本實現頂級性能,並堅持開放權重,將迫使其他競爭者降低價格或開放模型,以維持市場競爭力。
騰訊和阿里巴巴對AI的直接投資增加,預示著中國科技巨頭將從單純的財務投資轉向更深度的AI技術自主研發和生態整合。
兩大巨頭投入數十億美元用於自有模型和應用開發,並將AI深度整合到核心業務中,顯示其對AI戰略重要性的重新評估。

時間線

2023-07
DeepSeek成立,由量化對沖基金High-Flyer分拆獨立。
2024-01
DeepSeek-Coder系列模型發布,專注於程式碼智能。
2024-05
DeepSeek-V2發布,引入多模態能力和MoE架構,引發中國AI市場價格戰。
2025-01
DeepSeek-R1推理模型及其聊天應用發布,在全球下載榜單上表現突出,引發市場震動。
2026-04
DeepSeek-V4系列模型預覽版發布,包含1.6兆參數模型,具備1百萬token上下文窗口。
2026-05
DeepSeek啟動首輪外部融資,目標估值高達500億美元,由中國國家AI基金領投,騰訊參與。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅