🐯最新收集於 11m

DeepSeek 登上全球 AI 使用量第一

PostLinkedIn
🐯閱讀原文: 虎嗅

💡DeepSeek 每週 7.22 兆個 token,可能預示真實世界的模型採用格局正在改變。

⚡ 30-Second TL;DR

有什麼變化

DeepSeek 在全球 AI 模型每週使用量排名中登上第一。

為什麼重要

對 AI 建置者而言,DeepSeek 的使用規模顯示模型採用情況可能正快速轉向具備高效能、易取得性或成本優勢的供應商。開發者應評估實際工作負載的經濟效益,而不只依賴品牌知名度或基準測試標題。

下一步行動

以 DeepSeek 與目前使用的模型供應商進行一週工作負載比較,追蹤 token 成本、延遲、品質與失敗率。

誰應關注:Developers & AI Engineers

關鍵要點

  • DeepSeek 在全球 AI 模型每週使用量排名中登上第一。
  • 其每週使用量達到 7.22 兆個 token。
  • 據報導,這一規模已超越包括 OpenAI 在內的主要老牌業者。
  • 這項里程碑凸顯推理量正成為 AI 業者競爭的重要指標。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • DeepSeek 的推理成本優勢主要源於其創新的『混合專家模型』(MoE)架構,該架構大幅降低了單次推理所需的計算資源。
  • 該模型在開源社群中獲得極高採用率,許多開發者將其作為 OpenAI API 的高性價比替代方案,推動了其推理量的爆發式成長。
  • DeepSeek 採取了極致的工程優化策略,包括自研的通信庫與高效的算子優化,使其在有限的 GPU 資源下能處理更大規模的並發請求。
  • 市場分析指出,DeepSeek 的崛起標誌著 AI 產業從單純追求參數規模(Scaling Laws)轉向追求推理效率與單位成本效益(Inference Efficiency)。
  • DeepSeek 的高使用量不僅來自於其模型性能,還得益於其對 API 價格的激進定價策略,迫使全球 AI 模型供應商重新評估定價模型。
📊 競品分析▸ Show
特性DeepSeek (V3/R1)OpenAI (GPT-4o)Anthropic (Claude 3.5)
架構混合專家模型 (MoE)稠密/混合架構稠密架構
推理成本極低 (具價格破壞力)中高
開源狀態部分開源/權重開放閉源閉源
強項高性價比、推理效率生態系統、多模態整合程式碼能力、長文本

🛠️ 技術深入

  • 採用 DeepSeek-V3/R1 架構,利用 Multi-head Latent Attention (MLA) 技術顯著減少 KV Cache 的記憶體佔用。
  • 實施了 DeepSeekMoE 架構,透過細粒度專家劃分與共享專家機制,在保持模型容量的同時降低激活參數數量。
  • 訓練過程採用了大規模強化學習(RL)與長思維鏈(Chain-of-Thought)技術,提升了模型在複雜邏輯推理任務中的表現。
  • 基礎設施層面優化了 FP8 混合精度訓練與推理,進一步提升了在 NVIDIA H800/H100 等硬體上的吞吐量。

🔮 前景展望AI analysis grounded in cited sources

全球 AI 推理市場將進入『價格戰』階段
DeepSeek 的低成本模式已證明推理效率是獲取市佔率的關鍵,迫使競爭對手必須降低 API 價格以維持競爭力。
MoE 架構將成為未來大型語言模型的主流設計標準
DeepSeek 在推理量上的成功驗證了 MoE 在處理大規模請求時的卓越性能與成本效益。

時間線

2023-07
DeepSeek 成立並發布首個開源模型系列
2024-01
發布 DeepSeek-V2,首次引入高效的 MoE 架構
2024-12
發布 DeepSeek-V3,推理性能與成本效益大幅提升
2025-01
發布 DeepSeek-R1,強化推理能力並引發全球關注
2026-08
DeepSeek 推理量達到全球第一
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅