📱較早收集於 62m

DeepSeek 登頂全球調用榜單

DeepSeek 登頂全球調用榜單
PostLinkedIn
📱閱讀原文: Ifanr (爱范儿)

💡DeepSeek 登頂全球調用榜,標誌著 AI 模型採用趨勢與開發者偏好的重大轉變。

⚡ 30-Second TL;DR

有什麼變化

DeepSeek 成功登上全球 AI 模型調用榜首

為什麼重要

DeepSeek 的主導地位顯示市場正轉向追求極致性價比的模型,這對既有巨頭構成了挑戰。對於從業者而言,這驗證了將高效能替代模型整合至生產流程的可行性。

下一步行動

評估 DeepSeek API 與您目前模型供應商的效能表現,確認是否能在不犧牲輸出品質的前提下降低推理成本。

誰應關注:Developers & AI Engineers

關鍵要點

  • DeepSeek 成功登上全球 AI 模型調用榜首
  • 平台快速成長反映了開發者對高性價比、高效能 LLM 的強勁需求
  • Huawei 正為 Mate 90 開發更強大的晶片策略
  • Unitree Robotics 在最新一輪融資中估值達到 420 億人民幣

🧠 深度解析

Web-grounded analysis with 36 cited sources.

🔑 增強重點摘要

  • DeepSeek-V2及其後續模型採用了創新的混合專家(MoE)架構,該架構包含2360億總參數,但每個token僅激活210億參數,顯著提升了模型推理的成本效益和效率。
  • DeepSeek-V2透過多頭潛注意力(MLA)機制將鍵值(KV)快取記憶體使用量減少了93.3%,並結合DeepSeekMoE架構將訓練成本降低了42.5%,大幅優化了資源消耗。
  • DeepSeek於2024年5月推出的DeepSeek-V2以極具競爭力的API定價(輸入每百萬token 1元人民幣,輸出2元人民幣)引發了中國大型語言模型市場的價格戰,促使多家廠商跟進降價。
  • DeepSeek在2026年2月被OpenAI和Anthropic指控透過「模型蒸餾」方式,即大量調用其模型介面收集輸出數據來訓練自家模型,引發了關於人工智慧智慧財產權和技術競爭的討論。
  • DeepSeek-V2和DeepSeek-Coder-V2在多項基準測試中表現出色,特別是在程式碼生成和數學推理任務上,DeepSeek-Coder-V2在HumanEval基準測試中取得90.2%的高分,超越了GPT-4 Turbo、Claude 3 Opus和Gemini 1.5 Pro等閉源模型。
📊 競品分析▸ Show
模型/特點DeepSeek-V2/V2.5DeepSeek-V4 (預覽版)OpenAI GPT-4oMeta Llama 3 (70B)Mistral Large 3
架構MoE (236B總參數, 21B激活)MoETransformerTransformerTransformer
開源狀態部分開源部分開源閉源開源閉源
上下文視窗128K tokens百萬tokens長上下文128K tokens無限+ tokens
輸入定價 (每百萬tokens)約 $0.14 (人民幣1元)V4-Flash: 人民幣1元 (快取命中0.2元);V4-Pro: 人民幣12元 (快取命中1元)DeepSeek-V2.5便宜25倍免費 (開源)$0.50
輸出定價 (每百萬tokens)約 $0.28 (人民幣2元)V4-Flash: 人民幣2元;V4-Pro: 人民幣24元DeepSeek-V2.5便宜25倍免費 (開源)$1.50
HumanEval (程式碼)DeepSeek-Coder-V2: 90.2%-90.2%81.2% (70B), 88.4%46.5%
MATH (數學)DeepSeek V3: 90.2% (MATH-500)--51.8% (70B), 73.8%38.0%
MMLU (綜合)DeepSeek-V2: 78.5% (基礎)--88.5%80.7%

🛠️ 技術深入

  • 模型架構: DeepSeek-V2是一款混合專家(MoE)語言模型,總參數量為2360億,但在推理時每個token僅激活210億參數,實現了高效能與低成本。
  • 多頭潛注意力 (MLA): DeepSeek-V2引入了MLA機制,透過低秩鍵值壓縮(low-rank KV compression)顯著減少了93.3%的KV快取記憶體佔用,解決了推理時的記憶體瓶頸問題,並提升了生成吞吐量達5.76倍。
  • DeepSeekMoE 架構: 該架構優化了前饋網路(FFN),透過稀疏計算實現了更經濟的模型訓練,相較於DeepSeek-67B,訓練成本降低了42.5%。它採用了細粒度專家分割和共享專家隔離策略,以增強專業化並減少知識冗餘。
  • 上下文長度: DeepSeek-V2支援高達128K tokens的上下文長度,這得益於YaRN(Yet another RoPE variant)等長度外推訓練方法的優化。
  • 訓練數據: 模型在包含8.1兆(8.1T)tokens的高品質、多源語料庫上進行預訓練,並經過監督微調(SFT)和強化學習(RL)進一步優化。
  • 推理要求: 在BF16格式下運行DeepSeek-V2進行推理,需要8張80GB的GPU。
  • DeepSeek-Coder-V2: 作為DeepSeek-V2的延伸,DeepSeek-Coder-V2在DeepSeek-V2的一個中間檢查點基礎上,額外進行了6兆tokens的程式碼數據預訓練,支援338種程式語言。
  • DeepSeek-VL2: 該系列模型是基於MoE架構的視覺語言模型,在視覺組件上採用動態切片視覺編碼策略處理高解析度圖像,並在語言組件上利用DeepSeekMoE和MLA機制。

🔮 前景展望AI analysis grounded in cited sources

DeepSeek的成本效益模型將加速AI應用的普及化。
其低廉的API定價和高效能使其成為開發者構建高頻次、低成本AI解決方案的理想選擇,尤其是在Agent範式下能顯著降低單次任務總成本。
中國AI模型在全球市場的競爭力將持續增強。
DeepSeek在技術創新和成本控制方面的突破,證明了中國AI公司在面對國際制裁下的韌性和實力,並在中文特定任務上超越國際競爭對手。
AI模型知識產權和「模型蒸餾」的法律爭議將日益加劇。
來自OpenAI和Anthropic的指控凸顯了在模型訓練中數據來源和方法透明度的重要性,可能促使更嚴格的行業規範和法律框架的建立。

時間線

2023-07
深度求索人工智能基礎技術研究有限公司成立。
2023-11
DeepSeek發布首個模型DeepSeek Coder。
2024-01
DeepSeek發布DeepSeek-MoE模型,探索混合專家架構。
2024-05
DeepSeek-V2發布,採用MoE和MLA架構,並以極具競爭力的API價格引發市場價格戰。
2024-06
DeepSeek-Coder-V2發布,在程式碼相關任務上性能媲美頂級閉源模型。
2026-02
OpenAI和Anthropic指控DeepSeek透過「模型蒸餾」訓練其模型。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Ifanr (爱范儿)