🐯較早收集於 86m

兩會信號AI領跑轉變

兩會信號AI領跑轉變
PostLinkedIn
🐯閱讀原文: 虎嗅
#china-policy#tech-signals#ai-efficiencydeepseekdeepseek

💡中國AI政策全球領跑 + DeepSeek制裁下高效洞見(24字)

⚡ 30-Second TL;DR

有什麼變化

十五五規劃將科技目標從追趕轉為關鍵領域領跑,包括AI。

為什麼重要

信號持續支持高效AI開發,有利資源受限創新者。創造具真實市場驗證的AI應用機會。

下一步行動

基準測試DeepSeek模型,對照您的堆疊優化晶片高效推理。

誰應關注:Founders & Product Leaders

關鍵要點

  • 十五五規劃將科技目標從追趕轉為關鍵領域領跑,包括AI。
  • DeepSeek證明中國工程師在資源與晶片受限下實現頂尖AI。
  • 兩會AI政策將強調通過補貼轉商業驗證的應用。
  • 研發支出達GDP 2.68%,新能源汽車、電池、光伏專利全球領先。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • DeepSeek於2023年7月由High-Flyer量化對沖基金創辦人梁文峰在杭州成立,專注於開源AI模型開發。[3]
  • DeepSeek R1模型於2025年1月發布,訓練成本僅560萬美元,使用Nvidia H800晶片,在第三方基準測試中超越Meta Llama 3.1、OpenAI GPT-4o及Anthropic Claude Sonnet 3.5。[2]
  • 中國AI模型包括DeepSeek需遵守國家規定,體現「核心社會主義價值」,並過濾如天安門事件等敏感內容。[2]
  • DeepSeek使用美國Nvidia晶片訓練,但面臨美國出口管制疑慮,可能涉及H100走私或違規使用。[4]
📊 競品分析▸ Show
模型架構訓練成本基準表現
DeepSeek R1MoE, 選擇性激活$5.6M超越Llama 3.1, GPT-4o, Claude 3.5 (數學、編碼、推理)[2]
Meta Llama 3.1密集Transformer高額 (未公開)被DeepSeek超越[2]
OpenAI GPT-4o密集巨額投資被DeepSeek超越[2]
Anthropic Claude Sonnet 3.5密集高額被DeepSeek超越[2]

🛠️ 技術深入

  • DeepSeek R1採用Mixture-of-Experts (MoE)架構,僅激活相關子網路,降低推理計算開銷,並使用選擇性激活及轉移學習優化資源。[1]
  • 訓練流程:預訓練1.8T tokens (87%源碼),長上下文預訓練200B tokens (至16K),監督微調2B tokens。[3]
  • DeepSeek-V3為671B參數MoE模型 (每token激活37B),使用Multi-head Latent Attention (MLA)、DeepSeekMoE、無輔助損失負載平衡、多token預測 (MTP)目標,預訓練14.8T tokens,僅需2.788M H800 GPU小時。[5]
  • DeepSeek-V2預訓練8.1T tokens (中國tokens佔比12%較多),使用YaRN擴展上下文至128K。[3]

🔮 前景展望AI analysis grounded in cited sources

中國AI將更依賴演算法效率而非硬體規模
DeepSeek證明出口管制促使MoE等創新,降低對美國晶片依賴,並將效率視為AI競爭新關鍵參數。[1]
開源MoE模型加速全球AI應用民主化
R1以MIT授權免費發布,降低中小企業進入門檻,適用於邊緣設備、聊天機器人及產業應用。[1]
美國晶片管制效果減弱,中國自給生態加速
DeepSeek使用H20/H800訓練成功,儘管面臨管制,但推動華為Ascend等國產晶片用於推理,威脅美國領導地位。[3][4]

時間線

2023-07
DeepSeek由梁文峰在杭州成立,受High-Flyer資助
2024-12
DeepSeek V3發布,展示MoE效率創新
2025-01
DeepSeek R1發布,成本低效高震撼矽谷
2025-05
DeepSeek R1-0528更新,支持系統提示及函數呼叫
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。