🇭🇰較早收集於 2m

美國企業轉向 DeepSeek 以尋求高性價比 AI 解決方案

美國企業轉向 DeepSeek 以尋求高性價比 AI 解決方案
PostLinkedIn
🇭🇰閱讀原文: SCMP Technology

💡美國企業正捨棄 OpenAI 轉向 DeepSeek,了解成本效益如何重塑企業 AI 格局。

⚡ 30-Second TL;DR

有什麼變化

DeepSeek 在 6 月份的 Ramp 軟體供應商趨勢榜單中排名第一。

為什麼重要

此轉變顯示 AI 商品化正在加速,迫使頂級模型供應商必須重新評估其定價策略。這可能會導致市場競爭加劇,並促進企業工作流程中對多元且具成本效益 LLM 的廣泛採用。

下一步行動

評估您目前的 LLM API 支出,並將 DeepSeek 的效能與您現有的模型進行基準測試,以找出潛在的成本節省機會。

誰應關注:Enterprise & Security Teams

關鍵要點

  • DeepSeek 在 6 月份的 Ramp 軟體供應商趨勢榜單中排名第一。
  • 美國企業正積極以更便宜的替代方案取代昂貴的 AI 服務。
  • 成本效益正成為企業採用 AI 的主要驅動力。

🧠 深度解析

Web-grounded analysis with 28 cited sources.

🔑 增強重點摘要

  • DeepSeek在Ramp趨勢榜單上的崛起,顯示美國企業正直接向DeepSeek支付費用,透過其中國託管的伺服器傳輸數據,這引發了潛在的競爭和數據安全疑慮。
  • DeepSeek已對其旗艦模型DeepSeek V4-Pro實施永久性75%降價,使其API成本顯著低於(最高達7至9倍)OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7等競爭對手,此舉歸因於效率提升而非促銷。
  • DeepSeek的模型,特別是DeepSeek-V2和V4,採用了專家混合(MoE)架構和多頭潛在注意力(MLA)機制,以在顯著降低推理成本和減少KV快取需求的同時實現高性能,這是其成本效益的關鍵。
  • DeepSeek的成功正加劇對主要AI供應商(如OpenAI、Anthropic和Google)的降價壓力,可能導致更廣泛的AI價格戰,並使開源模型對企業更具吸引力。
📊 競品分析▸ Show
特性/指標DeepSeekOpenAIAnthropic
主要模型DeepSeek V4 Pro, DeepSeek-V2, DeepSeek-R1, DeepSeek-CoderGPT-4, GPT-5.5Claude Opus 4.7, Claude 系列
定價 (每百萬Token)V4 Pro: 輸入 $0.003625 - 輸出 $0.87 (永久降價後);最便宜模型輸入 $0.01GPT-5.5: 輸入 $5 - 輸出 $30;GPT-4 (2025年) $15 (輸入+輸出)Claude Opus 4.7: 輸入 $5 - 輸出 $25;最便宜模型輸入 $0.25
基準測試表現V4 Pro在BenchLM暫定排行榜排名#37/119 (得分69/100);MATH基準測試90.2%領先;DeepSeek-Coder-Instruct 33B在HumanEval超越GPT-3.5 TurboGPT-4為業界標竿;DeepSeek-R1與GPT-4表現相當Claude 3 Opus為前沿模型,性能強勁
關鍵技術/特性專家混合(MoE)架構、多頭潛在注意力(MLA)、DeepSeekMoE、開源權重、最高1M Token上下文、原生多模態(V4)專有模型、高能力專有模型、高準確性與安全性
市場定位高性價比、開源替代方案,挑戰現有市場領導者市場領導者、前沿研究、高階企業應用早期採用者青睞、注重安全與對齊、主流企業應用

🛠️ 技術深入

  • 模型架構:DeepSeek模型(如V2和V4)採用創新的專家混合(Mixture-of-Experts, MoE)設計,將模型劃分為專業的「專家」子網路。在處理過程中,路由機制會動態選擇最相關的專家,確保每次查詢僅啟動總參數的一小部分,顯著降低記憶體和計算需求。例如,DeepSeek-V2總參數為2360億,但每個Token僅啟動160億至210億參數。DeepSeek V4 Pro總參數達1.6兆,每個Token啟動約490億參數。
  • 注意力機制:引入多頭潛在注意力(Multi-head Latent Attention, MLA),這是一種新穎的注意力機制,透過低秩鍵值聯合壓縮來消除推理時鍵值快取的瓶頸,從而實現高效推理。
  • MoE效率:DeepSeekMoE架構是一種高效能的MoE架構,旨在實現經濟的訓練和高效的推理。
  • 上下文長度:DeepSeek-V2支援128K Token的上下文長度。DeepSeek V4 Pro進一步擴展至1M Token的上下文窗口。
  • 訓練數據與方法:DeepSeek-V2在包含8.1兆Token的多元高品質語料庫上進行預訓練,隨後進行監督式微調(SFT)和強化學習(RL)。DeepSeek-Coder模型則在約2兆Token的數據集上從頭開始訓練,其中包含87%的程式碼和13%的自然語言(英語和中文)。
  • 開源策略:DeepSeek的模型被描述為「開源權重」(open-weight),意味著模型的確切參數是公開共享的,並且自2025年1月DeepSeek-R1首次亮相以來,新模型主要以MIT許可證提供。
  • 稀疏注意力:DeepSeek V3.2採用DeepSeek稀疏注意力(DeepSeek Sparse Attention, DSA),可將長上下文API呼叫的推理成本降低50-75%。
  • Engram條件記憶體:DeepSeek V4中使用的Engram系統將靜態事實與動態推理分離,顯著提高了在1M Token長上下文中的資訊檢索準確性。
  • 多模態能力:DeepSeek V4從頭開始進行原生多模態訓練,支援文字、圖像、影片和音訊。

🔮 前景展望AI analysis grounded in cited sources

AI模型商品化將加速,導致價格戰加劇。
DeepSeek大幅降價並將其永久化,將迫使其他主要供應商降低價格以保持競爭力,使AI模型成為更普遍的商品。
企業對AI解決方案的採用將更加注重成本效益和實際ROI。
隨著企業AI支出增加,對可衡量影響和成本節約的需求將促使企業優先選擇像DeepSeek這樣提供高性價比的替代方案,而非僅追求最先進但昂貴的模型。
地緣政治因素將持續影響企業AI供應鏈決策。
美國企業直接使用中國DeepSeek的服務,即使存在數據安全和競爭疑慮,也顯示成本壓力可能超越地緣政治考量,但這些疑慮仍將是企業長期策略中的重要考量。

時間線

2023-07
DeepSeek 成立,由中國對沖基金High-Flyer創辦人梁文鋒創立。
2024-05
DeepSeek-V2 模型發布,引入MoE架構,因成本效益在中國市場廣受歡迎。
2025-01
DeepSeek-R1 推理模型及其聊天機器人應用發布,在美國App Store下載量排名第一,並引發美國科技股下跌。
2025-12
DeepSeek-V3.2 模型發布,提供長上下文推理和工具使用,並採用MIT許可證免費使用。
2026-04
DeepSeek V4 (Base) 發布,具有1兆參數和1M Token上下文窗口。
2026-05
DeepSeek V4 Pro 模型宣布永久降價75%,大幅降低API成本,加劇AI市場價格競爭。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: SCMP Technology