📱Ifanr (爱范儿)•較早收集於 62m
DeepSeek 登頂全球調用榜單

💡DeepSeek 登頂全球調用榜,標誌著 AI 模型採用趨勢與開發者偏好的重大轉變。
⚡ 30-Second TL;DR
有什麼變化
DeepSeek 成功登上全球 AI 模型調用榜首
為什麼重要
DeepSeek 的主導地位顯示市場正轉向追求極致性價比的模型,這對既有巨頭構成了挑戰。對於從業者而言,這驗證了將高效能替代模型整合至生產流程的可行性。
下一步行動
評估 DeepSeek API 與您目前模型供應商的效能表現,確認是否能在不犧牲輸出品質的前提下降低推理成本。
誰應關注:Developers & AI Engineers
關鍵要點
- •DeepSeek 成功登上全球 AI 模型調用榜首
- •平台快速成長反映了開發者對高性價比、高效能 LLM 的強勁需求
- •Huawei 正為 Mate 90 開發更強大的晶片策略
- •Unitree Robotics 在最新一輪融資中估值達到 420 億人民幣
🧠 深度解析
Web-grounded analysis with 36 cited sources.
🔑 增強重點摘要
- •DeepSeek-V2及其後續模型採用了創新的混合專家(MoE)架構,該架構包含2360億總參數,但每個token僅激活210億參數,顯著提升了模型推理的成本效益和效率。
- •DeepSeek-V2透過多頭潛注意力(MLA)機制將鍵值(KV)快取記憶體使用量減少了93.3%,並結合DeepSeekMoE架構將訓練成本降低了42.5%,大幅優化了資源消耗。
- •DeepSeek於2024年5月推出的DeepSeek-V2以極具競爭力的API定價(輸入每百萬token 1元人民幣,輸出2元人民幣)引發了中國大型語言模型市場的價格戰,促使多家廠商跟進降價。
- •DeepSeek在2026年2月被OpenAI和Anthropic指控透過「模型蒸餾」方式,即大量調用其模型介面收集輸出數據來訓練自家模型,引發了關於人工智慧智慧財產權和技術競爭的討論。
- •DeepSeek-V2和DeepSeek-Coder-V2在多項基準測試中表現出色,特別是在程式碼生成和數學推理任務上,DeepSeek-Coder-V2在HumanEval基準測試中取得90.2%的高分,超越了GPT-4 Turbo、Claude 3 Opus和Gemini 1.5 Pro等閉源模型。
📊 競品分析▸ Show
| 模型/特點 | DeepSeek-V2/V2.5 | DeepSeek-V4 (預覽版) | OpenAI GPT-4o | Meta Llama 3 (70B) | Mistral Large 3 |
|---|---|---|---|---|---|
| 架構 | MoE (236B總參數, 21B激活) | MoE | Transformer | Transformer | Transformer |
| 開源狀態 | 部分開源 | 部分開源 | 閉源 | 開源 | 閉源 |
| 上下文視窗 | 128K tokens | 百萬tokens | 長上下文 | 128K tokens | 無限+ tokens |
| 輸入定價 (每百萬tokens) | 約 $0.14 (人民幣1元) | V4-Flash: 人民幣1元 (快取命中0.2元);V4-Pro: 人民幣12元 (快取命中1元) | DeepSeek-V2.5便宜25倍 | 免費 (開源) | $0.50 |
| 輸出定價 (每百萬tokens) | 約 $0.28 (人民幣2元) | V4-Flash: 人民幣2元;V4-Pro: 人民幣24元 | DeepSeek-V2.5便宜25倍 | 免費 (開源) | $1.50 |
| HumanEval (程式碼) | DeepSeek-Coder-V2: 90.2% | - | 90.2% | 81.2% (70B), 88.4% | 46.5% |
| MATH (數學) | DeepSeek V3: 90.2% (MATH-500) | - | - | 51.8% (70B), 73.8% | 38.0% |
| MMLU (綜合) | DeepSeek-V2: 78.5% (基礎) | - | - | 88.5% | 80.7% |
🛠️ 技術深入
- 模型架構: DeepSeek-V2是一款混合專家(MoE)語言模型,總參數量為2360億,但在推理時每個token僅激活210億參數,實現了高效能與低成本。
- 多頭潛注意力 (MLA): DeepSeek-V2引入了MLA機制,透過低秩鍵值壓縮(low-rank KV compression)顯著減少了93.3%的KV快取記憶體佔用,解決了推理時的記憶體瓶頸問題,並提升了生成吞吐量達5.76倍。
- DeepSeekMoE 架構: 該架構優化了前饋網路(FFN),透過稀疏計算實現了更經濟的模型訓練,相較於DeepSeek-67B,訓練成本降低了42.5%。它採用了細粒度專家分割和共享專家隔離策略,以增強專業化並減少知識冗餘。
- 上下文長度: DeepSeek-V2支援高達128K tokens的上下文長度,這得益於YaRN(Yet another RoPE variant)等長度外推訓練方法的優化。
- 訓練數據: 模型在包含8.1兆(8.1T)tokens的高品質、多源語料庫上進行預訓練,並經過監督微調(SFT)和強化學習(RL)進一步優化。
- 推理要求: 在BF16格式下運行DeepSeek-V2進行推理,需要8張80GB的GPU。
- DeepSeek-Coder-V2: 作為DeepSeek-V2的延伸,DeepSeek-Coder-V2在DeepSeek-V2的一個中間檢查點基礎上,額外進行了6兆tokens的程式碼數據預訓練,支援338種程式語言。
- DeepSeek-VL2: 該系列模型是基於MoE架構的視覺語言模型,在視覺組件上採用動態切片視覺編碼策略處理高解析度圖像,並在語言組件上利用DeepSeekMoE和MLA機制。
🔮 前景展望AI analysis grounded in cited sources
DeepSeek的成本效益模型將加速AI應用的普及化。
其低廉的API定價和高效能使其成為開發者構建高頻次、低成本AI解決方案的理想選擇,尤其是在Agent範式下能顯著降低單次任務總成本。
中國AI模型在全球市場的競爭力將持續增強。
DeepSeek在技術創新和成本控制方面的突破,證明了中國AI公司在面對國際制裁下的韌性和實力,並在中文特定任務上超越國際競爭對手。
AI模型知識產權和「模型蒸餾」的法律爭議將日益加劇。
來自OpenAI和Anthropic的指控凸顯了在模型訓練中數據來源和方法透明度的重要性,可能促使更嚴格的行業規範和法律框架的建立。
⏳ 時間線
2023-07
深度求索人工智能基礎技術研究有限公司成立。
2023-11
DeepSeek發布首個模型DeepSeek Coder。
2024-01
DeepSeek發布DeepSeek-MoE模型,探索混合專家架構。
2024-05
DeepSeek-V2發布,採用MoE和MLA架構,並以極具競爭力的API價格引發市場價格戰。
2024-06
DeepSeek-Coder-V2發布,在程式碼相關任務上性能媲美頂級閉源模型。
2026-02
OpenAI和Anthropic指控DeepSeek透過「模型蒸餾」訓練其模型。
📎 來源 (36)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- szlh.gov.cn
- mltalks.com
- chipstrat.com
- csdn.net
- baai.ac.cn
- qiita.com
- modelscope.cn
- qiita.com
- github.com
- arxiv.org
- juejin.cn
- csdn.net
- volcengine.com
- awtmt.com
- longbridge.com
- wikipedia.org
- wikipedia.org
- popai.pro
- csdn.net
- volcengine.com
- winzheng.com
- github.com
- medium.com
- llmpricecheck.com
- cnyes.com
- 1111.com.tw
- sapling.ai
- llmbase.ai
- huggingface.co
- tencent.com
- docsbot.ai
- benchlm.ai
- llm-stats.com
- llm-stats.com
- github.com
- themoonlight.io
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Ifanr (爱范儿) ↗

