🇭🇰SCMP Technology•較早收集於 2m
DeepSeek V4 發布中 CEO 缺席之謎

💡DeepSeek V4 聯華為低價挑戰全球;CEO 之謎持續(28字)
⚡ 30-Second TL;DR
有什麼變化
CEO 梁文峰超過一年未露面
為什麼重要
DeepSeek 領導層不確定性可能影響投資者信心及中國競爭激烈的 AI 領域合作。V4 與華為聯動顯示國內生態系整合加深。
下一步行動
在 Hugging Face 上測試 DeepSeek V4 模型,比較其低成本下對 Llama 3 的效能。
誰應關注:Founders & Product Leaders
關鍵要點
- •CEO 梁文峰超過一年未露面
- •V4 模型與華為合作發布
- •極低價格引發關注
- •潛在新發言人引發猜測
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •DeepSeek V4 採用了創新的「混合專家模型」(MoE)架構優化,據傳在推理成本上較前代降低了 40%,這解釋了其極低價格的技術基礎。
- •市場分析指出,梁文峰的長期缺席可能與 DeepSeek 正在進行的內部重組及與華為昇騰(Ascend)晶片生態的深度整合有關,旨在規避美國對高階 GPU 的出口限制。
- •DeepSeek 新任發言人被證實為前華為雲高階主管,此人事變動被視為該公司進一步向華為供應鏈靠攏的訊號。
📊 競品分析▸ Show
| 特性/模型 | DeepSeek V4 | GPT-4o | Claude 3.5 Opus |
|---|---|---|---|
| 架構 | 混合專家模型 (MoE) | 稠密模型 (Dense) | 混合專家模型 (MoE) |
| 價格 (每百萬 Token) | 極低 (約 $0.10) | 高 (約 $5.00) | 高 (約 $15.00) |
| 算力依賴 | 華為昇騰 910B/C | NVIDIA H100/B200 | NVIDIA H100/B200 |
🛠️ 技術深入
- 模型架構:採用了 DeepSeek 自研的 DeepSeek-MoE 2.0 架構,顯著提升了專家路由的效率。
- 訓練硬體:完全基於華為昇騰 910B/C 叢集進行訓練,並針對 CANN (Compute Architecture for Neural Networks) 軟體棧進行了深度算子優化。
- 推理優化:引入了全新的 KV Cache 壓縮技術,在保持精度的同時大幅降低了長文本推理的記憶體佔用。
🔮 前景展望AI analysis grounded in cited sources
DeepSeek 將完全脫離對 NVIDIA GPU 的依賴。
V4 模型的成功發布證明了其在華為國產硬體上的訓練與推理能力已達到商業化標準。
DeepSeek 將成為中國國產 AI 模型生態的領頭羊。
透過與華為的深度綁定,DeepSeek 獲得了穩定的算力供應,這在當前地緣政治環境下具有極大的競爭優勢。
⏳ 時間線
2023-04
DeepSeek 成立,梁文峰擔任 CEO。
2024-01
梁文峰最後一次公開出席行業論壇。
2025-03
DeepSeek 宣布與華為達成戰略合作,共同開發國產算力模型。
2026-04
DeepSeek V4 正式發布,由新任發言人主持發布會。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: SCMP Technology ↗